DeepSeek V4 Pro vs GPT-5.6 Luna:贏了品質,輸了帳單
拿 5 萬筆對戰紀錄跑統計檢定,DeepSeek V4 Pro 在 29 個維度贏 10 個、輸 1 個、18 個分不出來。但換一個變體,站得住的只剩兩個。而它現在的價格是對手的 1.8 到 5.4 倍,尖峰時段剛好蓋住台灣的上班時間。
目錄(12 節)
這兩個模型常被放在一起問,因為它們曾經是同一個價格帶的真實二選一:都便宜、都新、都號稱夠用。
拿公開對戰資料跑統計檢定,結果是 DeepSeek V4 Pro 在 29 個維度裡顯著贏 10 個、輸 1 個、18 個分不出勝負。
但價格那邊翻轉了。用 2026 年 8 月 25 日的官方牌價算,DeepSeek V4 Pro 比 GPT-5.6 Luna 貴 1.8 到 2.7 倍,而且那還是離峰價。尖峰再乘二。
先給選擇規則
| 情況 | 選誰 |
|---|---|
| 一般用途、預算敏感 | GPT-5.6 Luna,便宜四成以上,而品質分不出來 |
| 長題目、醫療類問答 | DeepSeek V4 Pro,換哪個變體來比都站得住的就這兩塊 |
| 大量批次、時間可排 | DeepSeek 離峰時段跑,價差會縮一半 |
| 台灣上班時間的即時服務 | 不要選 DeepSeek,那正好是它的尖峰 |
| 要跑數學 | 兩個都不是首選,這組裡數學是 Luna 贏 |
這張表是下面各節結論的摘要,不含新資料,每一條的依據見對應章節。
底下說明每一條是怎麼來的。
29 個維度:贏 10 個,輸 1 個,18 個分不出來
資料來自 LMArena 的 leaderboard-dataset,快照日 2026 年 8 月 21 日,授權 CC BY 4.0。
用的是 text_style_control 這個設定,它會把排版風格的影響排掉。同樣的內容排版漂亮一點就比較容易被選,不控制的話,量到的會有一部分是排版而不是能力。
兩邊的樣本量差很多:DeepSeek V4 Pro 有 54,263 筆對戰、總排名第 52,GPT-5.6 Luna 有 20,693 筆、第 63。
判斷有沒有差距,有一個常見的錯法:把兩邊各自的信賴區間畫出來,看它們有沒有重疊。那個檢定過度保守,會把真的有差距的判成沒有。
正確的做法是先算兩邊的差值,再算這個差值自己的信賴區間。下面那張圖畫的就是後者,所以看的是橫線有沒有碰到 0,不是兩條區間有沒有重疊。
LMArena text_style_control 設定,2026-08-21 快照。deepseek-v4-pro 有 54,263 筆對戰紀錄,gpt-5.6-luna-xhigh 有 20,693 筆。分數為 Bradley-Terry 評分。信賴區間由兩邊變異數相加開根號乘 1.96 得出。
這張圖看橫線的長度比看點的位置重要。
18 個分不出勝負的維度裡有兩種完全不同的情況。英文的信賴區間是 ±8.8、寫程式 ±10.4,那是真的兩家打平。日文 ±46.4、德文 ±37.4、西班牙文 ±30.5,那不是打平,是投票數太少量不出來。
把這兩種都寫成「差不多」會誤導人。下面的表只列通過修正的五個,就是為了避開這件事。
| 維度 | DeepSeek V4 Pro | GPT-5.6 Luna | 差 | 95% 信賴區間 |
|---|---|---|---|---|
| 醫療健康 | 1476.8 | 1434.0 | +42.9 | +23.8 到 +62.0 |
| 創意寫作 | 1444.7 | 1407.4 | +37.3 | +24.6 到 +50.0 |
| 生命與自然科學 | 1480.9 | 1454.7 | +26.3 | +13.3 到 +39.3 |
| 長題目 | 1472.6 | 1451.6 | +20.9 | +11.8 到 +30.0 |
| 數學 | 1444.7 | 1481.1 | −36.3 | −58.8 到 −13.8 |
同一份 2026-08-21 快照,只列通過 Bonferroni 修正的五個維度。分數是 Bradley-Terry 評分,不是百分比,跨維度不可直接相減。
這五個是通過 Bonferroni 修正之後還站得住的。29 個維度同時比,光靠運氣也會有幾個看起來達標,這個修正就是把門檻拉高來扣掉那個機率。
另外五個只過了一般門檻,包含多輪對話、指令遵循、總分。
18 個分不出來就是分不出來。這篇不會把沒過門檻的差距講成優勢。
輸的那個維度是數學,而寫程式分不出來
這 29 個維度裡,DeepSeek 只顯著輸掉一個,是數學,差 36.3 分。這跟「中國模型數學強」的印象相反。
不是單一雜訊:產業向的數理那格方向一致,DeepSeek 也低 15.5 分,只是沒到顯著。兩個數理維度同時偏向 Luna。
要注意這兩個維度量的是人類在對戰裡的偏好,不是解題正確率。它反映的是回答讓人更想選哪一個,兩者相關但不等價。
反過來,最多人關心的那個維度給了一個沒人想聽的答案。寫程式差 4.2 分,信賴區間從 −6.3 到 +14.6,整段跨過 0。產業向的軟體與 IT 服務差 0.1 分,那是兩條疊在一起的線。
用這份資料選「哪個比較會寫程式」,答案是看不出來。
換一個 DeepSeek 變體,站得住的只剩兩個維度
榜上的 DeepSeek 有三個條目,上面用的是基礎檔 deepseek-v4-pro。另外還有一個推理檔 deepseek-v4-pro-high-20260813。
而 OpenAI 那邊只有 gpt-5.6-luna-xhigh 一個條目,是最高推理檔。所以上面那場比較,是 DeepSeek 的基礎檔對上 Luna 的最強設定。
把 DeepSeek 也換成推理檔重跑,結果整個縮水:21 個維度裡贏 2 個、輸 0 個、19 個分不出來,而且沒有任何一個通過 Bonferroni。
但這不能讀成「其實兩家一樣」。推理檔那個條目只有 3,621 筆對戰,信賴區間 ±9.9,是基礎檔 ±4.0 的兩倍寬。檢定力不夠也會長得像沒有差距。
比較誠實的讀法是取交集:不管拿哪個 DeepSeek 變體去比,兩次都站得住的只有長題目與醫療健康這兩個維度。
那兩個才是這組配對真正的結論,其餘的證據都比表面上看起來薄。
值得留意的是這兩個維度的性質。長題目量的是題幹長、條件多的請求,醫療類則是專業術語密集的問答。
兩個都偏向「輸入很長」的用法,而那正好是價格差距最大的那一段。品質站得住的地方,剛好也是帳單最痛的地方。
價格翻轉了:現在貴的是 DeepSeek
半個月前這組還是一個有趣的成本題,因為兩家的輸入與輸出價高低相反,會有交叉點。現在不用算了。
DeepSeek 官方定價頁在 8 月下旬調過價,同時把原本標示「尚未生效」的尖離峰定價實施了。GPT-5.6 Luna 則維持 7 月底那次降價後的水準。
| 每 1M tokens | DeepSeek V4 Pro 尖峰 | DeepSeek V4 Pro 離峰 | GPT-5.6 Luna |
|---|---|---|---|
| 輸入(快取未命中) | $1.32 | $0.66 | $0.20 |
| 輸入(快取命中) | $0.044 | $0.022 | $0.02 |
| 輸出 | $3.96 | $1.98 | $1.20 |
DeepSeek 官方定價頁與 OpenAI 模型頁,2026-08-25 實查。單位為 USD 每 1M tokens。
就算拿離峰價比,DeepSeek 的輸入還是貴 3.3 倍、輸出貴 1.65 倍。兩項都貴就沒有交叉點可言,任何輸入輸出比例下都是 Luna 便宜。
| 輸入對輸出 | DeepSeek 離峰 | DeepSeek 尖峰 | GPT-5.6 Luna | Luna 比離峰便宜 |
|---|---|---|---|---|
| 0.5 : 1 | $2.310 | $4.620 | $1.300 | 44% |
| 1 : 1 | $2.640 | $5.280 | $1.400 | 47% |
| 2 : 1 | $3.300 | $6.600 | $1.600 | 52% |
| 5 : 1 | $5.280 | $10.560 | $2.200 | 58% |
| 10 : 1 | $8.580 | $17.160 | $3.200 | 63% |
以上表牌價換算,每 100 萬個輸出 token 搭配對應比例的輸入 token。2026-08-25 牌價,未計快取命中。
輸入佔比越高差距越大。RAG 跟長文摘要那種吃輸入的工作,離峰都要多付將近六成,尖峰是兩倍多。牌價的完整對照在價格表。
快取也救不回來。DeepSeek 離峰的快取命中價 $0.022 跟 Luna 的 $0.02 幾乎一樣,看起來是打平的一格。
但快取命中價一樣會隨時段翻倍,尖峰是 $0.044。輸入吃重的工作最需要快取,而那類服務通常就跑在白天。
還有一條路本文沒有算進去:DeepSeek V4 Pro 是 MIT 授權,權重可以自己架或找第三方代管。那是完全不同的一條成本曲線,牽涉到 GPU 租金與運維人力,這篇比的是兩家官方 API 的牌價。
尖峰時段換算成台灣時間,剛好是上班時間
官方寫的是「尖峰為 UTC 週一到週五的 01:00 到 04:00 與 06:00 到 10:00」,離峰價是尖峰的一半。
換成台灣時間就是週一到週五的 09:00 到 12:00 與 14:00 到 18:00。
那不是隨機的七個小時,那是台灣的上班時段扣掉午休。
DeepSeek 官方定價頁標示的尖峰時段(UTC 週一至週五 01:00 至 04:00 與 06:00 至 10:00)換算為台灣時間,2026-08-25 實查。
這件事對兩種人的意義完全相反。做內部工具、跑批次、可以排在深夜的,離峰價確實拿得到。做的是給客戶用的即時服務,那尖峰價才是你的日常價,上面那張離峰欄可以直接忽略。
看牌價的第一個數字選模型,在這一家會低估一倍。
這份資料答不了的兩件事
公開資料的好處是可重跑,代價是它只回答它量過的東西。這篇有兩個位置刻意留白。
中文誰比較強
繁中內容最常見的問題是「哪個模型中文最好」,而這份資料的誠實答案是不知道。
中文那個維度 DeepSeek 高 17.5 分,但這個差距的信賴區間從 −3.2 到 +38.1,跨過 0。兩邊的投票數只有 2,857 與 1,471,那是區間拉這麼寬的原因。
區間的寬度是那 17.5 分的兩倍多。硬排名次就是把雜訊當結論。
繁中內容講中文能力時普遍是印象派的說法,例如「略勝一籌」或「比較像台灣人寫的」。這篇的立場是:連獨立評測都還答不了,那些說法就更沒有來源。
真要回答這題,得換一把量得到繁中的尺,那是另一篇的事。
廠商自己公布的數字
那換官方公布的 benchmark 呢?這組配對填不起來。
OpenAI 對 GPT-5.6 Luna 沒有公布任何 benchmark。模型頁只有規格、定價與速率限制,整個 API 文件站都不刊 benchmark 分數。
DeepSeek 有完整的表,但對不上。官方 model card 的主力數字來自 V4-Pro-Max 這個最高推理檔,部分項目用的還是 Base 模型,而且官方選的對照組是 GPT-4.6 與 Gemini 3.1,裡面沒有 Luna。
還有一層更實際的障礙。DeepSeek 定價頁與發布公告上的 benchmark 表是 PNG 圖片,機器讀不到,只能人工看著抄。
所以廠商數字不只是「主張不是證據」而已。在便宜檔這一層,主張連拿都拿不到;拿得到的那家,公布的是另一個推理檔配自己挑的對照組。
這也是為什麼本文的主結構用第三方對戰資料:它有原始檔、有授權、有快照日期,任何人都可以拿同一份重跑一次,得到同樣的數字。
本站自己量到的,只能當補充
本站的實測在這組配對裡覆蓋不完整,兩邊常常只有一邊有數字。所以列出來當佐證,不當結論。
- 學測數學 B 16 題:GPT-5.6 Luna 答對 14 題。DeepSeek V4 Pro 沒有量過,同廠的 V4-Flash 是 16 題全對
- 台灣連線延遲:GPT-5.6 Luna 首字 p50 是 976 毫秒、每秒 334 個字元,19 次取樣。DeepSeek 還沒進量測名單
- 繁中 token 係數:DeepSeek 的係數是從開放權重版本推及到 API 型號的,誤差 12.9%,不能跟實測值並排看
數學那項剛好跟 Arena 的方向一致,兩把不同的尺指向同一件事,但 16 題撐不起一個結論,只能說沒有互相矛盾。
今天可以做的一件事
打開本站的 token 計算器,把你最近一次真實的請求貼進去,算出你的輸入與輸出各是多少 token。
然後只做一個判斷:那些請求送出的時間,落在台灣時間的 09:00 到 12:00 或 14:00 到 18:00 嗎?
如果是,而你正在用 DeepSeek,你付的是上面那張表的尖峰欄。把可以延後的批次工作挪出這兩段,帳單直接砍半,模型一個都不用換。