Pick Model

模型比較

DeepSeek V4 Pro vs GPT-5.6 Luna:贏了品質,輸了帳單

拿 5 萬筆對戰紀錄跑統計檢定,DeepSeek V4 Pro 在 29 個維度贏 10 個、輸 1 個、18 個分不出來。但換一個變體,站得住的只剩兩個。而它現在的價格是對手的 1.8 到 5.4 倍,尖峰時段剛好蓋住台灣的上班時間。

目錄(12 節)
  1. 先給選擇規則
  2. 29 個維度:贏 10 個,輸 1 個,18 個分不出來
  3. 輸的那個維度是數學,而寫程式分不出來
  4. 換一個 DeepSeek 變體,站得住的只剩兩個維度
  5. 價格翻轉了:現在貴的是 DeepSeek
  6. 尖峰時段換算成台灣時間,剛好是上班時間
  7. 這份資料答不了的兩件事
  8. 中文誰比較強
  9. 廠商自己公布的數字
  10. 本站自己量到的,只能當補充
  11. 今天可以做的一件事
  12. 資料來源

這兩個模型常被放在一起問,因為它們曾經是同一個價格帶的真實二選一:都便宜、都新、都號稱夠用。

拿公開對戰資料跑統計檢定,結果是 DeepSeek V4 Pro 在 29 個維度裡顯著贏 10 個、輸 1 個、18 個分不出勝負。

但價格那邊翻轉了。用 2026 年 8 月 25 日的官方牌價算,DeepSeek V4 Pro 比 GPT-5.6 Luna 貴 1.8 到 2.7 倍,而且那還是離峰價。尖峰再乘二。

先給選擇規則

情況 選誰
一般用途、預算敏感 GPT-5.6 Luna,便宜四成以上,而品質分不出來
長題目、醫療類問答 DeepSeek V4 Pro,換哪個變體來比都站得住的就這兩塊
大量批次、時間可排 DeepSeek 離峰時段跑,價差會縮一半
台灣上班時間的即時服務 不要選 DeepSeek,那正好是它的尖峰
要跑數學 兩個都不是首選,這組裡數學是 Luna 贏

這張表是下面各節結論的摘要,不含新資料,每一條的依據見對應章節。

底下說明每一條是怎麼來的。

29 個維度:贏 10 個,輸 1 個,18 個分不出來

資料來自 LMArena 的 leaderboard-dataset,快照日 2026 年 8 月 21 日,授權 CC BY 4.0。

用的是 text_style_control 這個設定,它會把排版風格的影響排掉。同樣的內容排版漂亮一點就比較容易被選,不控制的話,量到的會有一部分是排版而不是能力。

兩邊的樣本量差很多:DeepSeek V4 Pro 有 54,263 筆對戰、總排名第 52,GPT-5.6 Luna 有 20,693 筆、第 63。

判斷有沒有差距,有一個常見的錯法:把兩邊各自的信賴區間畫出來,看它們有沒有重疊。那個檢定過度保守,會把真的有差距的判成沒有。

正確的做法是先算兩邊的差值,再算這個差值自己的信賴區間。下面那張圖畫的就是後者,所以看的是橫線有沒有碰到 0,不是兩條區間有沒有重疊。

29 個維度的分數差,由大到小 每一列一個維度。點是兩邊的分數差,橫線是 95% 信賴區間。 橫線只要碰到 0,就是分不出勝負;橫線越長,代表那個維度量得越少。 0 醫療健康 創意寫作 波蘭文 韓文 日文 生命與自然科學 長題目 多輪對話 中文 寫作與語文 娛樂運動媒體 法文 非英文 法律與政府 指令遵循 俄文 排除平手 困難題 總分 寫程式 英文 困難題英文 軟體與 IT 商管與財務 西班牙文 專家題 數理產業 德文 數學 -60 -40 -20 0 +20 +40 +60 +80 ← GPT-5.6 Luna 較高 DeepSeek V4 Pro 較高 →

LMArena text_style_control 設定,2026-08-21 快照。deepseek-v4-pro 有 54,263 筆對戰紀錄,gpt-5.6-luna-xhigh 有 20,693 筆。分數為 Bradley-Terry 評分。信賴區間由兩邊變異數相加開根號乘 1.96 得出。

這張圖看橫線的長度比看點的位置重要。

18 個分不出勝負的維度裡有兩種完全不同的情況。英文的信賴區間是 ±8.8、寫程式 ±10.4,那是真的兩家打平。日文 ±46.4、德文 ±37.4、西班牙文 ±30.5,那不是打平,是投票數太少量不出來。

把這兩種都寫成「差不多」會誤導人。下面的表只列通過修正的五個,就是為了避開這件事。

維度 DeepSeek V4 Pro GPT-5.6 Luna 差 95% 信賴區間
醫療健康 1476.8 1434.0 +42.9 +23.8 到 +62.0
創意寫作 1444.7 1407.4 +37.3 +24.6 到 +50.0
生命與自然科學 1480.9 1454.7 +26.3 +13.3 到 +39.3
長題目 1472.6 1451.6 +20.9 +11.8 到 +30.0
數學 1444.7 1481.1 −36.3 −58.8 到 −13.8

同一份 2026-08-21 快照,只列通過 Bonferroni 修正的五個維度。分數是 Bradley-Terry 評分,不是百分比,跨維度不可直接相減。

這五個是通過 Bonferroni 修正之後還站得住的。29 個維度同時比,光靠運氣也會有幾個看起來達標,這個修正就是把門檻拉高來扣掉那個機率。

另外五個只過了一般門檻,包含多輪對話、指令遵循、總分。

18 個分不出來就是分不出來。這篇不會把沒過門檻的差距講成優勢。

輸的那個維度是數學,而寫程式分不出來

這 29 個維度裡,DeepSeek 只顯著輸掉一個,是數學,差 36.3 分。這跟「中國模型數學強」的印象相反。

不是單一雜訊:產業向的數理那格方向一致,DeepSeek 也低 15.5 分,只是沒到顯著。兩個數理維度同時偏向 Luna。

要注意這兩個維度量的是人類在對戰裡的偏好,不是解題正確率。它反映的是回答讓人更想選哪一個,兩者相關但不等價。

反過來,最多人關心的那個維度給了一個沒人想聽的答案。寫程式差 4.2 分,信賴區間從 −6.3 到 +14.6,整段跨過 0。產業向的軟體與 IT 服務差 0.1 分,那是兩條疊在一起的線。

用這份資料選「哪個比較會寫程式」,答案是看不出來。

換一個 DeepSeek 變體,站得住的只剩兩個維度

榜上的 DeepSeek 有三個條目,上面用的是基礎檔 deepseek-v4-pro。另外還有一個推理檔 deepseek-v4-pro-high-20260813。

而 OpenAI 那邊只有 gpt-5.6-luna-xhigh 一個條目,是最高推理檔。所以上面那場比較,是 DeepSeek 的基礎檔對上 Luna 的最強設定。

把 DeepSeek 也換成推理檔重跑,結果整個縮水:21 個維度裡贏 2 個、輸 0 個、19 個分不出來,而且沒有任何一個通過 Bonferroni。

但這不能讀成「其實兩家一樣」。推理檔那個條目只有 3,621 筆對戰,信賴區間 ±9.9,是基礎檔 ±4.0 的兩倍寬。檢定力不夠也會長得像沒有差距。

比較誠實的讀法是取交集:不管拿哪個 DeepSeek 變體去比,兩次都站得住的只有長題目與醫療健康這兩個維度。

那兩個才是這組配對真正的結論,其餘的證據都比表面上看起來薄。

值得留意的是這兩個維度的性質。長題目量的是題幹長、條件多的請求,醫療類則是專業術語密集的問答。

兩個都偏向「輸入很長」的用法,而那正好是價格差距最大的那一段。品質站得住的地方,剛好也是帳單最痛的地方。

價格翻轉了:現在貴的是 DeepSeek

半個月前這組還是一個有趣的成本題,因為兩家的輸入與輸出價高低相反,會有交叉點。現在不用算了。

DeepSeek 官方定價頁在 8 月下旬調過價,同時把原本標示「尚未生效」的尖離峰定價實施了。GPT-5.6 Luna 則維持 7 月底那次降價後的水準。

每 1M tokens DeepSeek V4 Pro 尖峰 DeepSeek V4 Pro 離峰 GPT-5.6 Luna
輸入(快取未命中) $1.32 $0.66 $0.20
輸入(快取命中) $0.044 $0.022 $0.02
輸出 $3.96 $1.98 $1.20

DeepSeek 官方定價頁與 OpenAI 模型頁,2026-08-25 實查。單位為 USD 每 1M tokens。

就算拿離峰價比,DeepSeek 的輸入還是貴 3.3 倍、輸出貴 1.65 倍。兩項都貴就沒有交叉點可言,任何輸入輸出比例下都是 Luna 便宜。

輸入對輸出 DeepSeek 離峰 DeepSeek 尖峰 GPT-5.6 Luna Luna 比離峰便宜
0.5 : 1 $2.310 $4.620 $1.300 44%
1 : 1 $2.640 $5.280 $1.400 47%
2 : 1 $3.300 $6.600 $1.600 52%
5 : 1 $5.280 $10.560 $2.200 58%
10 : 1 $8.580 $17.160 $3.200 63%

以上表牌價換算,每 100 萬個輸出 token 搭配對應比例的輸入 token。2026-08-25 牌價,未計快取命中。

輸入佔比越高差距越大。RAG 跟長文摘要那種吃輸入的工作,離峰都要多付將近六成,尖峰是兩倍多。牌價的完整對照在價格表。

快取也救不回來。DeepSeek 離峰的快取命中價 $0.022 跟 Luna 的 $0.02 幾乎一樣,看起來是打平的一格。

但快取命中價一樣會隨時段翻倍,尖峰是 $0.044。輸入吃重的工作最需要快取,而那類服務通常就跑在白天。

還有一條路本文沒有算進去:DeepSeek V4 Pro 是 MIT 授權,權重可以自己架或找第三方代管。那是完全不同的一條成本曲線,牽涉到 GPU 租金與運維人力,這篇比的是兩家官方 API 的牌價。

尖峰時段換算成台灣時間,剛好是上班時間

官方寫的是「尖峰為 UTC 週一到週五的 01:00 到 04:00 與 06:00 到 10:00」,離峰價是尖峰的一半。

換成台灣時間就是週一到週五的 09:00 到 12:00 與 14:00 到 18:00。

那不是隨機的七個小時,那是台灣的上班時段扣掉午休。

台灣時間,週一至週五 尖峰 尖峰 離峰 離峰 離峰 00 03 06 09 12 15 18 21 24 一般上班時間 09:00 至 18:00 尖峰價是離峰價的兩倍,午休那兩小時是唯一的縫

DeepSeek 官方定價頁標示的尖峰時段(UTC 週一至週五 01:00 至 04:00 與 06:00 至 10:00)換算為台灣時間,2026-08-25 實查。

這件事對兩種人的意義完全相反。做內部工具、跑批次、可以排在深夜的,離峰價確實拿得到。做的是給客戶用的即時服務,那尖峰價才是你的日常價,上面那張離峰欄可以直接忽略。

看牌價的第一個數字選模型,在這一家會低估一倍。

這份資料答不了的兩件事

公開資料的好處是可重跑,代價是它只回答它量過的東西。這篇有兩個位置刻意留白。

中文誰比較強

繁中內容最常見的問題是「哪個模型中文最好」,而這份資料的誠實答案是不知道。

中文那個維度 DeepSeek 高 17.5 分,但這個差距的信賴區間從 −3.2 到 +38.1,跨過 0。兩邊的投票數只有 2,857 與 1,471,那是區間拉這麼寬的原因。

區間的寬度是那 17.5 分的兩倍多。硬排名次就是把雜訊當結論。

繁中內容講中文能力時普遍是印象派的說法,例如「略勝一籌」或「比較像台灣人寫的」。這篇的立場是:連獨立評測都還答不了,那些說法就更沒有來源。

真要回答這題,得換一把量得到繁中的尺,那是另一篇的事。

廠商自己公布的數字

那換官方公布的 benchmark 呢?這組配對填不起來。

OpenAI 對 GPT-5.6 Luna 沒有公布任何 benchmark。模型頁只有規格、定價與速率限制,整個 API 文件站都不刊 benchmark 分數。

DeepSeek 有完整的表,但對不上。官方 model card 的主力數字來自 V4-Pro-Max 這個最高推理檔,部分項目用的還是 Base 模型,而且官方選的對照組是 GPT-4.6 與 Gemini 3.1,裡面沒有 Luna。

還有一層更實際的障礙。DeepSeek 定價頁與發布公告上的 benchmark 表是 PNG 圖片,機器讀不到,只能人工看著抄。

所以廠商數字不只是「主張不是證據」而已。在便宜檔這一層,主張連拿都拿不到;拿得到的那家,公布的是另一個推理檔配自己挑的對照組。

這也是為什麼本文的主結構用第三方對戰資料:它有原始檔、有授權、有快照日期,任何人都可以拿同一份重跑一次,得到同樣的數字。

本站自己量到的,只能當補充

本站的實測在這組配對裡覆蓋不完整,兩邊常常只有一邊有數字。所以列出來當佐證,不當結論。

  • 學測數學 B 16 題:GPT-5.6 Luna 答對 14 題。DeepSeek V4 Pro 沒有量過,同廠的 V4-Flash 是 16 題全對
  • 台灣連線延遲:GPT-5.6 Luna 首字 p50 是 976 毫秒、每秒 334 個字元,19 次取樣。DeepSeek 還沒進量測名單
  • 繁中 token 係數:DeepSeek 的係數是從開放權重版本推及到 API 型號的,誤差 12.9%,不能跟實測值並排看

數學那項剛好跟 Arena 的方向一致,兩把不同的尺指向同一件事,但 16 題撐不起一個結論,只能說沒有互相矛盾。

今天可以做的一件事

打開本站的 token 計算器,把你最近一次真實的請求貼進去,算出你的輸入與輸出各是多少 token。

然後只做一個判斷:那些請求送出的時間,落在台灣時間的 09:00 到 12:00 或 14:00 到 18:00 嗎?

如果是,而你正在用 DeepSeek,你付的是上面那張表的尖峰欄。把可以延後的批次工作挪出這兩段,帳單直接砍半,模型一個都不用換。

資料來源

  1. LMArena leaderboard-dataset(本文的對戰評分來源,CC BY 4.0)
  2. Creative Commons BY 4.0 授權條款
  3. DeepSeek 官方 API 定價頁(含尖離峰時段)
  4. OpenAI GPT-5.6 Luna 模型頁(規格與定價)
  5. DeepSeek-V4-Pro 官方 model card