Claude Sonnet 5 vs GPT-5.6 Terra:繁中貴三成,長文反而便宜
兩顆同價位帶的中階模型,近 4.8 萬筆公開對戰紀錄在 29 個維度上分不出勝負,多重比較校正後兩邊都是 0。分得出來的是帳單:同一份繁體中文,Claude Sonnet 5 的輸入貴 32%;但輸入一超過 272,000 token,GPT-5.6 Terra 整包改以兩倍計價,便宜的那個當場換人。
目錄(12 節)
這兩顆模型是同一個價格帶裡的真正二選一。輸入牌價一模一樣,都是 $2 / 1M tokens,輸出是 $10 對 $12。
拿近 4.8 萬筆公開對戰紀錄跑統計檢定,29 個維度裡 Claude Sonnet 5 顯著較高的有 4 個、GPT-5.6 Terra 有 1 個,剩下 24 個分不出來。做完多重比較校正,兩邊都變成 0 個。
分得出來的是帳單。同一份繁體中文,Claude Sonnet 5 的輸入貴 31.9%。但輸入一旦超過 272,000 token,GPT-5.6 Terra 整包改以兩倍計價,便宜的那個當場換人。
先給選擇規則
| 情況 | 選誰 |
|---|---|
| 一般長度的繁體中文請求 | GPT-5.6 Terra,同一份輸入少 24% 的 token |
| 輸入超過約 21 萬個繁體中文字 | Claude Sonnet 5,對手過了門檻整包翻倍 |
| 要即時回應的介面 | GPT-5.6 Terra,從台灣量到的首字是 787 對 1,350 毫秒 |
| 需要 2026 年 2 月以後的知識 | GPT-5.6 Terra,另一顆的可靠知識截止在 1 月 |
| 想靠品質分高下 | 這份資料分不出來,不要拿它當理由 |
本表是下面各節結論的摘要,不含新資料,每一條的依據見對應章節。
底下說明每一條是怎麼來的。
29 個維度,校正之後兩邊都是 0
對戰資料來自 LMArena 的 leaderboard-dataset,快照日 2026 年 8 月 21 日,授權 CC BY 4.0。
用的是 text_style_control 這個設定,它會把排版風格的影響排掉。不控制的話,量到的會有一部分是排版而不是能力。
兩邊的樣本量相近:Claude Sonnet 5 有 27,366 筆對戰、總排名第 45,GPT-5.6 Terra 有 20,216 筆、第 44。
判斷有沒有差距,常見的錯法是把兩邊各自的信賴區間畫出來看有沒有重疊。那個檢定過度保守,會把真的有差距的判成沒有。
正確的做法是先算兩邊的差值,再算這個差值自己的信賴區間。下面這張圖畫的就是後者,所以看的是橫線有沒有碰到 0。
資料為 LMArena leaderboard-dataset,text_style_control 設定,快照日 2026-08-21。橫線是分數差的 95% 信賴區間,用 z = (r_a − r_b) / √(var_a + var_b) 算出。
看得出來的形狀是:所有的點都擠在 0 附近,而橫線最長的幾個維度(法文、日文、德文、波蘭文、韓文)票數都在 500 上下,區間寬到 ±32 至 ±50 分。那不是差距,是量得不夠。
以 p<.05 這個寬鬆門檻算,Claude Sonnet 5 在醫療健康、生命與自然科學、長題目、困難題英文這 4 個維度較高,GPT-5.6 Terra 在非英文這 1 個維度較高。
但 29 個維度同時檢定,光靠運氣就會跑出大約 1.5 個假陽性。做 Bonferroni 校正之後門檻升到 |z| > 3.13,兩邊都是 0 個。
總分那一列最能說明狀況:1,461.2 對 1,465.4,差 4.2 分,區間 ±7.2。兩邊的總排名是第 45 與第 44。
名字後面那個 high 和 xhigh
榜上這兩筆分別是 claude-sonnet-5-high 與 gpt-5.6-terra-xhigh,也就是各自在某一個推理強度設定下的成績,不是模型的全部。
上一篇比 DeepSeek 那組時,同一顆模型在榜上有三個變體,可以拿變體之間的交集當穩健性檢查。這組沒有第二個變體,那個手法在這裡用不上。
牌價只差在輸出那 2 塊錢
| 項目 | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|
| 輸入 $ / 1M | 2 | 2 |
| 輸出 $ / 1M | 10 | 12 |
| 快取讀取 $ / 1M | 0.20 | 0.20 |
| 快取寫入 $ / 1M | 2.50 | 2.50 |
| context window | 1,000,000 | 1,050,000 |
| 最大輸出 | 128,000 | 128,000 |
| 可靠知識截止 | 2026 年 1 月 | 2026 年 2 月 16 日 |
牌價與規格取自兩家官方文件,本站 價格對照表查證於 2026-08-25。快取寫入兩邊都是輸入價的 1.25 倍,五分鐘效期。
七個欄位裡有五個一樣。唯一的差是輸出價,Claude Sonnet 5 便宜 16.7%。
如果比較到這裡就停,結論會是「品質分不出來,輸出便宜的那個划算一點」。接下來兩節說明為什麼那個結論會反過來。
換成繁體中文,便宜的那個換人
牌價是「每個 token 多少錢」,帳單是「這段文字被切成幾個 token,再乘上牌價」。中間那一步兩家差很多。
本站拿一份 14,951 字的繁體中文語料,直接打兩家的計數 API 量過。兩顆都是實測值,不是從同家族推及來的。
| 模型 | 每字 token | 每萬字 token | 輸入 $ | 輸出 $ |
|---|---|---|---|---|
| Claude Sonnet 5 | 1.7198 | 17,198 | 0.0344 | 0.1720 |
| GPT-5.6 Terra | 1.3041 | 13,041 | 0.0261 | 0.1565 |
每 10,000 個繁體中文字的 token 數與費用,語料 14,951 繁中字(五種文體混合),量測於 2026-08-12。方法與全部 23 個模型的比例見繁中 token 成本實測。
同一份繁體中文,Claude Sonnet 5 要多切出 31.9% 的 token。輸入牌價一樣,所以輸入成本原封不動貴 31.9%。
輸出那邊更值得看。牌價上 Claude Sonnet 5 便宜 16.7%,乘上 token 數之後變成貴 9.9%。方向整個翻過來。
這不是誰對中文比較友善的問題,是 tokenizer 的合併規則由訓練語料統計決定,而且它是廠商層級的選擇。在同一家裡換型號改不掉。
272,000 token 那道門檻,過了就整包重算
GPT-5.6 Terra 有一條 官方文件寫明的階梯:輸入超過 272,000 token 時,該次請求全額改以 2 倍輸入、1.5 倍輸出計價。
關鍵在「全額」。不是超出的部分才漲,是整包重新計價,所以它是一階而不是一個坡。
用上一節的係數換算,272,000 token 大約是 208,600 個繁體中文字。
單次請求的輸入費用,橫軸為繁體中文字數。牌價查證於 2026-08-25,token 係數量測於 2026-08-12,兩者的有效期不一樣。
門檻前一刻,這份輸入在 GPT-5.6 Terra 是 $0.54、在 Claude Sonnet 5 是 $0.72。門檻後一刻,同一份輸入在 GPT-5.6 Terra 變成 $1.09。
而且過了就回不去。門檻之後 GPT-5.6 Terra 的斜率比 Claude Sonnet 5 陡,兩條線不會再交叉一次。輸出側同理,$18 對 $10,換算繁中之後 Claude Sonnet 5 便宜 27%。
Anthropic 那邊沒有這道門檻。官方定價頁寫的是整個 1M context window 都用標準價,並且明講 90 萬 token 的請求跟 9 千 token 的請求費率相同。
1M context 裝得下多少繁體中文字?
兩家標的 context window 差不多,但那是 token 額度,換算成繁體中文字之後差距會被 tokenizer 放大。
| 模型 | context window | 扣掉最大輸出的輸入額度 | 換算繁體中文字 |
|---|---|---|---|
| Claude Sonnet 5 | 1,000,000 | 872,000 | 507,050 |
| GPT-5.6 Terra | 1,050,000 | 922,000 | 707,023 |
輸入額度為 context window 減去最大輸出,再除以本站量到的每字 token 數。GPT-5.6 Terra 的 922,000 是官方模型頁自己印的 max input tokens,跟這個算式對得起來。
GPT-5.6 Terra 能吞下的繁體中文字多出 39%。但它的 20.9 萬字門檻在那 70 萬字額度的前三分之一,所以額度剩下的三分之二是兩倍價。
Claude Sonnet 5 的 50 萬字則是從頭到尾同一個費率。要一次丟進去的東西越長,這件事越重要。
從台灣打,Terra 的首字快了一半
| 模型 | 首字 p50 ms | 首字 p95 ms | 字/秒 p50 | 連線 p50 ms | n |
|---|---|---|---|---|---|
| Claude Sonnet 5 | 1,350 | 2,555 | 158 | 101.1 | 19 |
| GPT-5.6 Terra | 787 | 1,360 | 270 | 104.8 | 19 |
從台北實測,2026-08-16 至 18,各 19 次成功呼叫,百分位用 nearest-rank 不內插。完整方法與其他六個模型見台灣連線延遲實測。
首字延遲 787 對 1,350 毫秒,吐字速度 270 對 158 字元。兩項都是 GPT-5.6 Terra 領先,而且 p95 差得更開。
差的不是距離。連線層(DNS 加 TCP 加 TLS)是 104.8 對 101.1 毫秒,兩家都有亞洲節點,這一段幾乎一樣。
兩邊的輸出長度中位數都是 110 個字元,代表比的是同一件事。輸出長度對不上的配對,多出來的毫秒是思考時間而不是速度差,本站的量測工具已經把那種列擋掉。
要提醒的是 n 只有 19,而且取樣集中在深夜與晚間兩個時段。這組數字撐得起「哪一顆比較快」的方向,撐不起精確倍數。
這組該怎麼選
先問一個問題:你的輸入會不會超過約 21 萬個繁體中文字。
不會的話,選 GPT-5.6 Terra。它在同一份繁體中文上少 24% 的 token、從台灣量到的首字快四成,而品質那邊沒有任何一個維度撐得住多重比較校正。
會的話,選 Claude Sonnet 5。門檻一過,兩倍計價會把 tokenizer 省下來的那 24% 連本帶利吃掉,而且再也不會翻回來。
真正麻煩的是介於中間的情況:平常兩三萬字,偶爾一次丟進去二十幾萬字。這時候拿一顆模型硬扛兩種負載會有一邊吃虧,把長文那條路由到另一顆才是省錢的作法。
至於「哪一顆比較聰明」,這篇沒有答案,因為近 4.8 萬筆對戰資料也給不出答案。把它當成決策依據,等於在雜訊上做選擇。
這篇答不了的三件事
公開資料的好處是可以重跑,代價是它只回答它量過的東西。有三個位置刻意留白。
中文能力誰比較強。 中文那個維度 GPT-5.6 Terra 高 18.7 分,但這個差的信賴區間是 ±22.2,跨過 0。票數只有 1,805 與 1,398,那是區間這麼寬的原因。繁中內容講中文能力時常見的「略勝一籌」,比這個資料還沒有來源。
本站的第三把尺是空的。 學測數學 B 那 16 題兩顆模型都沒跑過,所以這篇沒有獨立於對戰資料之外的能力量測。延遲與 token 係數量的是速度與帳單,不是答對率。
推理強度只有一組。 榜上這兩筆各是一個設定,換一個強度檔,成績會動、價格不會動。所以本文的成本結論比品質結論穩。
今天可以做的一件事
打開本站的 token 計算器,把你最長的那一份輸入貼進去,看它離 272,000 token 還有多遠。
如果那個數字在 20 萬以下,這篇的結論對你就是一句話:選 token 切得少的那顆。
如果它會撞到門檻,把長文那條路徑單獨拉出來,指到不會翻倍計價的那顆。改的是路由設定,不是整套系統。