拿學測數學 B 實測 9 個模型,最貴的不一定最準
同樣 16 題、同樣純文字輸入,最省的模型跟旗艦一樣滿分,成本只要 1/35。而標榜便宜的那個,帳單比旗艦還貴。
模型比較文大多在搬規格表。這篇不一樣:16 道台灣高中生今年真的考過的數學題,9 個模型一題一題跑,答對率跟帳單一起記。
測試怎麼設計的
- 題目:115 學測數學 B 第 1 到 17 題,單選 7、多選 5、選填 5
- 統一基準:全部純文字輸入、每題呼叫一次、比較同 16 題(第 3 題因故障排除)
- 判分:以多模型共識為答案基準
- 費率:採上游 2026 年 7 月公開牌價
結果:滿分有四個,價差 35 倍
| 模型 | 陣營 | 答對 | 成本 $ | vs opus |
|---|---|---|---|---|
| deepseek-v4-flash | 中國 | 16/16 | 0.009 | 省 35 倍 |
| gpt-5.4-mini | OpenAI | 10/16 | 0.045 | 7.1 倍 |
| gpt-5.6-luna | OpenAI | 14/16 | 0.081 | 3.9 倍 |
| haiku-4.5 | Claude | 13/16 | 0.085 | 3.7 倍 |
| qwen3.6-flash | 中國 | 15/16 | 0.086 | 3.7 倍 |
| glm-5-turbo | 中國 | 16/16 | 0.188 | 1.7 倍 |
| opus-5 | Claude | 16/16 | 0.317 | 基準 |
| gemini-3.5-flash | 16/16 | 0.379 | 0.8 倍,更貴 |
三個值得記住的點:
- deepseek-v4-flash 是壓倒性贏家:滿分品質,成本只要旗艦的 1/35
- gemini-3.5-flash 標榜便宜,實際帳單比最貴的 opus 還貴:它輸出太長,大多是隱藏的推理 token,把低單價的優勢全吃光
- 便宜不等於準:gpt-5.4-mini 只對 10/16,是全場最弱
這對你的選擇代表什麼
如果你的任務長得像「有標準答案的推理題」,那張價目表上的單價幾乎沒有參考價值,真正決定帳單的是模型話多不多。挑之前先用你自己的題目跑十題,把實際 token 花費算出來,比看任何 benchmark 排行榜都準。