Pick Model

模型比較

Claude Sonnet 5 vs GPT-5.6 Terra:繁中貴三成,長文反而便宜

兩顆同價位帶的中階模型,近 4.8 萬筆公開對戰紀錄在 29 個維度上分不出勝負,多重比較校正後兩邊都是 0。分得出來的是帳單:同一份繁體中文,Claude Sonnet 5 的輸入貴 32%;但輸入一超過 272,000 token,GPT-5.6 Terra 整包改以兩倍計價,便宜的那個當場換人。

目錄(12 節)
  1. 先給選擇規則
  2. 29 個維度,校正之後兩邊都是 0
  3. 名字後面那個 high 和 xhigh
  4. 牌價只差在輸出那 2 塊錢
  5. 換成繁體中文,便宜的那個換人
  6. 272,000 token 那道門檻,過了就整包重算
  7. 1M context 裝得下多少繁體中文字?
  8. 從台灣打,Terra 的首字快了一半
  9. 這組該怎麼選
  10. 這篇答不了的三件事
  11. 今天可以做的一件事
  12. 資料來源

這兩顆模型是同一個價格帶裡的真正二選一。輸入牌價一模一樣,都是 $2 / 1M tokens,輸出是 $10 對 $12。

拿近 4.8 萬筆公開對戰紀錄跑統計檢定,29 個維度裡 Claude Sonnet 5 顯著較高的有 4 個、GPT-5.6 Terra 有 1 個,剩下 24 個分不出來。做完多重比較校正,兩邊都變成 0 個。

分得出來的是帳單。同一份繁體中文,Claude Sonnet 5 的輸入貴 31.9%。但輸入一旦超過 272,000 token,GPT-5.6 Terra 整包改以兩倍計價,便宜的那個當場換人。

先給選擇規則

情況 選誰
一般長度的繁體中文請求 GPT-5.6 Terra,同一份輸入少 24% 的 token
輸入超過約 21 萬個繁體中文字 Claude Sonnet 5,對手過了門檻整包翻倍
要即時回應的介面 GPT-5.6 Terra,從台灣量到的首字是 787 對 1,350 毫秒
需要 2026 年 2 月以後的知識 GPT-5.6 Terra,另一顆的可靠知識截止在 1 月
想靠品質分高下 這份資料分不出來,不要拿它當理由

本表是下面各節結論的摘要,不含新資料,每一條的依據見對應章節。

底下說明每一條是怎麼來的。

29 個維度,校正之後兩邊都是 0

對戰資料來自 LMArena 的 leaderboard-dataset,快照日 2026 年 8 月 21 日,授權 CC BY 4.0。

用的是 text_style_control 這個設定,它會把排版風格的影響排掉。不控制的話,量到的會有一部分是排版而不是能力。

兩邊的樣本量相近:Claude Sonnet 5 有 27,366 筆對戰、總排名第 45,GPT-5.6 Terra 有 20,216 筆、第 44。

判斷有沒有差距,常見的錯法是把兩邊各自的信賴區間畫出來看有沒有重疊。那個檢定過度保守,會把真的有差距的判成沒有。

正確的做法是先算兩邊的差值,再算這個差值自己的信賴區間。下面這張圖畫的就是後者,所以看的是橫線有沒有碰到 0。

29 個維度的分數差,由大到小 點是 Claude Sonnet 5 減 GPT-5.6 Terra,橫線是這個差自己的 95% 信賴區間。 橫線碰到 0 就是分不出勝負;橫線越長,代表那個維度量得越少。 -60 -40 -20 0 +20 +40 +60 醫療健康 生命與自然科學 長題目 創意寫作 困難題英文 專家題 韓文 指令遵循 英文 寫程式 寫作與語文 困難題 軟體與 IT 波蘭文 俄文 娛樂運動媒體 德文 多輪對話 法律與政府 數理產業 商管與財務 總分 排除平手 日文 非英文 數學 中文 西班牙文 法文 分數差

資料為 LMArena leaderboard-dataset,text_style_control 設定,快照日 2026-08-21。橫線是分數差的 95% 信賴區間,用 z = (r_a − r_b) / √(var_a + var_b) 算出。

看得出來的形狀是:所有的點都擠在 0 附近,而橫線最長的幾個維度(法文、日文、德文、波蘭文、韓文)票數都在 500 上下,區間寬到 ±32 至 ±50 分。那不是差距,是量得不夠。

以 p<.05 這個寬鬆門檻算,Claude Sonnet 5 在醫療健康、生命與自然科學、長題目、困難題英文這 4 個維度較高,GPT-5.6 Terra 在非英文這 1 個維度較高。

但 29 個維度同時檢定,光靠運氣就會跑出大約 1.5 個假陽性。做 Bonferroni 校正之後門檻升到 |z| > 3.13,兩邊都是 0 個。

總分那一列最能說明狀況:1,461.2 對 1,465.4,差 4.2 分,區間 ±7.2。兩邊的總排名是第 45 與第 44。

名字後面那個 high 和 xhigh

榜上這兩筆分別是 claude-sonnet-5-high 與 gpt-5.6-terra-xhigh,也就是各自在某一個推理強度設定下的成績,不是模型的全部。

上一篇比 DeepSeek 那組時,同一顆模型在榜上有三個變體,可以拿變體之間的交集當穩健性檢查。這組沒有第二個變體,那個手法在這裡用不上。

牌價只差在輸出那 2 塊錢

項目 Claude Sonnet 5 GPT-5.6 Terra
輸入 $ / 1M 2 2
輸出 $ / 1M 10 12
快取讀取 $ / 1M 0.20 0.20
快取寫入 $ / 1M 2.50 2.50
context window 1,000,000 1,050,000
最大輸出 128,000 128,000
可靠知識截止 2026 年 1 月 2026 年 2 月 16 日

牌價與規格取自兩家官方文件,本站 價格對照表查證於 2026-08-25。快取寫入兩邊都是輸入價的 1.25 倍,五分鐘效期。

七個欄位裡有五個一樣。唯一的差是輸出價,Claude Sonnet 5 便宜 16.7%。

如果比較到這裡就停,結論會是「品質分不出來,輸出便宜的那個划算一點」。接下來兩節說明為什麼那個結論會反過來。

換成繁體中文,便宜的那個換人

牌價是「每個 token 多少錢」,帳單是「這段文字被切成幾個 token,再乘上牌價」。中間那一步兩家差很多。

本站拿一份 14,951 字的繁體中文語料,直接打兩家的計數 API 量過。兩顆都是實測值,不是從同家族推及來的。

模型 每字 token 每萬字 token 輸入 $ 輸出 $
Claude Sonnet 5 1.7198 17,198 0.0344 0.1720
GPT-5.6 Terra 1.3041 13,041 0.0261 0.1565

每 10,000 個繁體中文字的 token 數與費用,語料 14,951 繁中字(五種文體混合),量測於 2026-08-12。方法與全部 23 個模型的比例見繁中 token 成本實測。

同一份繁體中文,Claude Sonnet 5 要多切出 31.9% 的 token。輸入牌價一樣,所以輸入成本原封不動貴 31.9%。

輸出那邊更值得看。牌價上 Claude Sonnet 5 便宜 16.7%,乘上 token 數之後變成貴 9.9%。方向整個翻過來。

這不是誰對中文比較友善的問題,是 tokenizer 的合併規則由訓練語料統計決定,而且它是廠商層級的選擇。在同一家裡換型號改不掉。

272,000 token 那道門檻,過了就整包重算

GPT-5.6 Terra 有一條 官方文件寫明的階梯:輸入超過 272,000 token 時,該次請求全額改以 2 倍輸入、1.5 倍輸出計價。

關鍵在「全額」。不是超出的部分才漲,是整包重新計價,所以它是一階而不是一個坡。

用上一節的係數換算,272,000 token 大約是 208,600 個繁體中文字。

同一份繁體中文輸入,這一次請求的輸入費用 門檻是整包重算,不是只有超出的部分改價,所以是一階而不是一個坡。 $0.0 $0.5 $1.0 $1.5 $2.0 $2.5 $3.0 0 10 萬 20 萬 30 萬 40 萬 50 萬 輸入的繁體中文字數 272,000 token 門檻,約 209,000 字 Claude Sonnet 5 $1.72 GPT-5.6 Terra $2.61 $0.54 $1.09

單次請求的輸入費用,橫軸為繁體中文字數。牌價查證於 2026-08-25,token 係數量測於 2026-08-12,兩者的有效期不一樣。

門檻前一刻,這份輸入在 GPT-5.6 Terra 是 $0.54、在 Claude Sonnet 5 是 $0.72。門檻後一刻,同一份輸入在 GPT-5.6 Terra 變成 $1.09。

而且過了就回不去。門檻之後 GPT-5.6 Terra 的斜率比 Claude Sonnet 5 陡,兩條線不會再交叉一次。輸出側同理,$18 對 $10,換算繁中之後 Claude Sonnet 5 便宜 27%。

Anthropic 那邊沒有這道門檻。官方定價頁寫的是整個 1M context window 都用標準價,並且明講 90 萬 token 的請求跟 9 千 token 的請求費率相同。

1M context 裝得下多少繁體中文字?

兩家標的 context window 差不多,但那是 token 額度,換算成繁體中文字之後差距會被 tokenizer 放大。

模型 context window 扣掉最大輸出的輸入額度 換算繁體中文字
Claude Sonnet 5 1,000,000 872,000 507,050
GPT-5.6 Terra 1,050,000 922,000 707,023

輸入額度為 context window 減去最大輸出,再除以本站量到的每字 token 數。GPT-5.6 Terra 的 922,000 是官方模型頁自己印的 max input tokens,跟這個算式對得起來。

GPT-5.6 Terra 能吞下的繁體中文字多出 39%。但它的 20.9 萬字門檻在那 70 萬字額度的前三分之一,所以額度剩下的三分之二是兩倍價。

Claude Sonnet 5 的 50 萬字則是從頭到尾同一個費率。要一次丟進去的東西越長,這件事越重要。

從台灣打,Terra 的首字快了一半

模型 首字 p50 ms 首字 p95 ms 字/秒 p50 連線 p50 ms n
Claude Sonnet 5 1,350 2,555 158 101.1 19
GPT-5.6 Terra 787 1,360 270 104.8 19

從台北實測,2026-08-16 至 18,各 19 次成功呼叫,百分位用 nearest-rank 不內插。完整方法與其他六個模型見台灣連線延遲實測。

首字延遲 787 對 1,350 毫秒,吐字速度 270 對 158 字元。兩項都是 GPT-5.6 Terra 領先,而且 p95 差得更開。

差的不是距離。連線層(DNS 加 TCP 加 TLS)是 104.8 對 101.1 毫秒,兩家都有亞洲節點,這一段幾乎一樣。

兩邊的輸出長度中位數都是 110 個字元,代表比的是同一件事。輸出長度對不上的配對,多出來的毫秒是思考時間而不是速度差,本站的量測工具已經把那種列擋掉。

要提醒的是 n 只有 19,而且取樣集中在深夜與晚間兩個時段。這組數字撐得起「哪一顆比較快」的方向,撐不起精確倍數。

這組該怎麼選

先問一個問題:你的輸入會不會超過約 21 萬個繁體中文字。

不會的話,選 GPT-5.6 Terra。它在同一份繁體中文上少 24% 的 token、從台灣量到的首字快四成,而品質那邊沒有任何一個維度撐得住多重比較校正。

會的話,選 Claude Sonnet 5。門檻一過,兩倍計價會把 tokenizer 省下來的那 24% 連本帶利吃掉,而且再也不會翻回來。

真正麻煩的是介於中間的情況:平常兩三萬字,偶爾一次丟進去二十幾萬字。這時候拿一顆模型硬扛兩種負載會有一邊吃虧,把長文那條路由到另一顆才是省錢的作法。

至於「哪一顆比較聰明」,這篇沒有答案,因為近 4.8 萬筆對戰資料也給不出答案。把它當成決策依據,等於在雜訊上做選擇。

這篇答不了的三件事

公開資料的好處是可以重跑,代價是它只回答它量過的東西。有三個位置刻意留白。

中文能力誰比較強。 中文那個維度 GPT-5.6 Terra 高 18.7 分,但這個差的信賴區間是 ±22.2,跨過 0。票數只有 1,805 與 1,398,那是區間這麼寬的原因。繁中內容講中文能力時常見的「略勝一籌」,比這個資料還沒有來源。

本站的第三把尺是空的。 學測數學 B 那 16 題兩顆模型都沒跑過,所以這篇沒有獨立於對戰資料之外的能力量測。延遲與 token 係數量的是速度與帳單,不是答對率。

推理強度只有一組。 榜上這兩筆各是一個設定,換一個強度檔,成績會動、價格不會動。所以本文的成本結論比品質結論穩。

今天可以做的一件事

打開本站的 token 計算器,把你最長的那一份輸入貼進去,看它離 272,000 token 還有多遠。

如果那個數字在 20 萬以下,這篇的結論對你就是一句話:選 token 切得少的那顆。

如果它會撞到門檻,把長文那條路徑單獨拉出來,指到不會翻倍計價的那顆。改的是路由設定,不是整套系統。

資料來源

  1. LMArena leaderboard-dataset(本文的對戰評分來源,CC BY 4.0)
  2. Creative Commons BY 4.0 授權條款
  3. Anthropic 官方定價頁(含長 context 計價說明)
  4. Anthropic 模型總覽(context window 與知識截止日)
  5. OpenAI GPT-5.6 Terra 模型頁(規格、定價與階梯門檻)