拿學測數學 B 實測 9 個模型,最貴的不一定最準
同樣 16 題、同樣純文字輸入,最省的模型跟旗艦一樣滿分,成本只要 1/35。而標榜便宜的那個,帳單比旗艦還貴。
模型比較文大多在搬規格表。這篇不一樣:16 道台灣高中生今年真的考過的數學題,9 個模型一題一題跑,答對率跟帳單一起記。
價格更新(2026-08-25):DeepSeek 在 8 月下旬調漲 API 牌價,並把原本標示「尚未生效」的尖離峰定價實施了。deepseek-v4-flash 的每 1M tokens 從 $0.14 / $0.28 變成離峰 $0.22 / $0.66、尖峰 $0.44 / $1.32(尖峰為台灣時間週一至週五 09:00-12:00 與 14:00-18:00)。
下面的表格維持測試當下的費率沒有重算,因為原始檔只留了每個模型的總成本,沒有逐筆 token 數,重算會變成用比例推估。可以確定的是「省 35 倍」這個倍數在現在的牌價下不再成立,而 deepseek-v4-flash 也不再是表上最省的那一格。要重建這個數字得重跑一次並記下 token 用量。
現行牌價一律以價格對照表為準。
價格更新(2026-08-04):這篇發表兩天後,OpenAI 在 7/30 把 gpt-5.6-luna 降價 80%,每 1M tokens 從 $1.00 / $6.00 降到 $0.20 / $1.20(同批 Terra 也降了 20%)。原文的費率在發表當下是正確的,但用現在的價算,luna 的帳單只剩五分之一,所以下面的表格已依新價重算,它從第三便宜變成第二便宜。
同一批複查還發現 qwen3.6-flash 原文用的是折扣後的 $0.1875 / $1.125,官方牌價是 $0.25 / $1.5。表格維持折扣價,因為那是當時實際被收的錢,但牌價比這個高三分之一。
其餘六個模型的費率複查後與原文一致。完整的模型價格表在這裡。
測試怎麼設計的
- 題目:115 學測數學 B 第 1 到 17 題,單選 7、多選 5、選填 5
- 統一基準:全部純文字輸入、每題呼叫一次、比較同 16 題(第 3 題因故障排除)
- 判分:以多模型共識為答案基準
- 費率:採上游 2026 年 7 月公開牌價,gpt-5.6-luna 已依 7/30 降價後重算(見上方更新)
結果:滿分有四個,價差 35 倍
| 模型 | 陣營 | 答對 | 成本 $ | vs opus |
|---|---|---|---|---|
| deepseek-v4-flash | 中國 | 16/16 | 0.009 | 省 35 倍 |
| gpt-5.6-luna | OpenAI | 14/16 | 0.016 | 省 20 倍 |
| gpt-5.4-mini | OpenAI | 10/16 | 0.045 | 7.1 倍 |
| haiku-4.5 | Claude | 13/16 | 0.085 | 3.7 倍 |
| qwen3.6-flash | 中國 | 15/16 | 0.086 | 3.7 倍 |
| glm-5-turbo | 中國 | 16/16 | 0.188 | 1.7 倍 |
| opus-5 | Claude | 16/16 | 0.317 | 基準 |
| gemini-3.5-flash | 16/16 | 0.379 | 0.8 倍,更貴 |
三個值得記住的點:
- deepseek-v4-flash 是壓倒性贏家:滿分品質,成本只要旗艦的 1/35
- gemini-3.5-flash 標榜便宜,實際帳單比最貴的 opus 還貴:它輸出太長,大多是隱藏的推理 token,把低單價的優勢全吃光
- 便宜不等於準:gpt-5.4-mini 只對 10/16,是全場最弱。同一家的 luna 比它便宜將近三倍,還多對四題
這對你的選擇代表什麼
如果你的任務長得像「有標準答案的推理題」,那張價目表上的單價幾乎沒有參考價值,真正決定帳單的是模型話多不多。挑之前先用你自己的題目跑十題,把實際 token 花費算出來,比看任何 benchmark 排行榜都準。