Pick Model

實測

拿學測數學 B 實測 9 個模型,最貴的不一定最準

同樣 16 題、同樣純文字輸入,最省的模型跟旗艦一樣滿分,成本只要 1/35。而標榜便宜的那個,帳單比旗艦還貴。

模型比較文大多在搬規格表。這篇不一樣:16 道台灣高中生今年真的考過的數學題,9 個模型一題一題跑,答對率跟帳單一起記。

測試怎麼設計的

結果:滿分有四個,價差 35 倍

模型 陣營 答對 成本 $ vs opus
deepseek-v4-flash 中國 16/16 0.009 省 35 倍
gpt-5.4-mini OpenAI 10/16 0.045 7.1 倍
gpt-5.6-luna OpenAI 14/16 0.081 3.9 倍
haiku-4.5 Claude 13/16 0.085 3.7 倍
qwen3.6-flash 中國 15/16 0.086 3.7 倍
glm-5-turbo 中國 16/16 0.188 1.7 倍
opus-5 Claude 16/16 0.317 基準
gemini-3.5-flash Google 16/16 0.379 0.8 倍,更貴

三個值得記住的點:

這對你的選擇代表什麼

如果你的任務長得像「有標準答案的推理題」,那張價目表上的單價幾乎沒有參考價值,真正決定帳單的是模型話多不多。挑之前先用你自己的題目跑十題,把實際 token 花費算出來,比看任何 benchmark 排行榜都準。

資料來源

  1. 大學入學考試中心 115 學年度學科能力測驗試題