Pick Model

成本分析

繁體中文比簡體貴多少?八個 tokenizer 實測 3.7% 到 21%

把同一份繁體文件轉成簡體再送給模型,token 數會少 3.7% 到 21%,八個 tokenizer 全部往下走。但幅度差 5.8 倍,而且省最多的那家因此換了名次。這篇量的是省多少、什麼情況值得省,以及轉回繁體會掉幾個字。

目錄(12 節)
  1. 八家全部變便宜,但幅度差 5.8 倍
  2. GLM 不是貴,是沒有為繁體調過
  3. Claude 幾乎不動,最貴的還是最貴
  4. 連用詞一起換,多數再省 1%,Claude 反而變貴
  5. 你的文件越中文,省得越多,但不成正比
  6. 換字最多省 21%,換家最多省 36%
  7. 轉回繁體會掉字,回程設定用錯差 8 倍
  8. 什麼情況值得轉,什麼情況不值得
  9. 今天可以做的一件事
  10. 這些數字量了什麼、沒量什麼
  11. 三個沒量的
  12. 資料來源

價格更新(2026-08-25):下表 DeepSeek-V4-Flash 那一列的 $0.14 是 2026-08-13 量測當下的牌價。DeepSeek 已於 8 月下旬調價並實施尖離峰定價,現在是離峰 $0.22、尖峰 $0.44。這篇量的是 tokenizer 的字數差異,換算成錢的那兩欄會隨牌價走,現行價見價格對照表。

把同一份繁體中文文件轉成簡體再送給模型,token 數立刻少 3.7% 到 21%。

八個 tokenizer 量下來全部往下走,沒有一家例外。但幅度差很多:省最多的那家是省最少的 5.8 倍,而且它因為這個差距,在「誰比較便宜」的排名上跳了三名。

這是上一篇量 23 個模型留下來的問題。那篇的結論是各家的中文成本差異來自訓練語料的組成,不是來自中文這個語言。如果真是這樣,而語料裡的中文又以簡體居多,那把繁體換成簡體就應該會便宜。

確實會。但便宜的幅度,多數情況下不夠你把一條產線改掉。

八家全部變便宜,但幅度差 5.8 倍

同一份 14,951 字的繁中語料,用 OpenCC 轉成簡體字形之後重新計算。

Tokenizer 繁體 簡體字形 省下 量法
GLM 1.324 1.041 −21.4% 開放權重・精確
MiniMax 1.096 0.951 −13.2% 開放權重・推及
OpenAI o200k_base 1.304 1.169 −10.4% API
Qwen 1.219 1.117 −8.4% 開放權重・推及
DeepSeek 1.108 1.024 −7.6% 開放權重・推及
Gemini 1.165 1.117 −4.1% API
Anthropic 4.6 以前 1.650 1.586 −3.9% API
Anthropic 5 世代 1.720 1.656 −3.7% API

每個中文字平均切成幾個 token。量測於 2026-08-13。

值得先講清楚的是,這個折扣不是全文打折來的。繁轉簡實際動到的字只有 4,695 個,佔語料的 31%。其餘三分之二的字兩邊長得一模一樣,完全沒有變化的空間。

所以 GLM 那個 21.4%,是全部集中在三成的字上換來的。那三成字在繁體型態下被切得有多零碎,這個數字就有多大。

GLM 不是貴,是沒有為繁體調過

上一篇的表裡,GLM 是全場最貴的中文 tokenizer,1.324,比 OpenAI 還高。當時的解讀是它英文與程式碼的效率較差。換成簡體之後,那個解讀要修正。

名次 繁體最省 簡體最省 變化
1 MiniMax 1.096 MiniMax 0.951 不變
2 DeepSeek 1.108 DeepSeek 1.024 不變
3 Gemini 1.165 GLM 1.041 ↑ 3
4 Qwen 1.219 Gemini 1.117 ↓ 1
5 OpenAI o200k_base 1.304 Qwen 1.117 ↓ 1
6 GLM 1.324 OpenAI o200k_base 1.169 ↓ 1
7 Anthropic 4.6 以前 1.650 Anthropic 4.6 以前 1.586 不變
8 Anthropic 5 世代 1.720 Anthropic 5 世代 1.656 不變

同樣八個 tokenizer,各自用兩種字排一次。量測於 2026-08-13。

GLM 從第六名跳到第三名。它處理中文一點問題也沒有,它只是沒有把繁體字收進高頻的合併規則裡。對一個主要服務簡體市場的模型來說,這是完全合理的取捨,只是這個取捨的帳單會出現在台灣團隊身上。

這也說明這件事是可以修的,而且有人修過。Breeze-7B 的技術報告記載他們在 Mistral 的詞表上加了 29,873 個 token、擴到 61,872 個,繁中語料的壓縮率因此變成原本的兩倍左右。詞表補上去,稅就不見了。

差別在於那是自己訓練模型才有的選項。用 API 的人動不了詞表,只能動送進去的字。

Claude 幾乎不動,最貴的還是最貴

排名表最下面兩列從頭到尾沒動過。Anthropic 兩個世代的折扣是 3.9% 與 3.7%,是全場最小的兩個。

這對正在用 Claude 又在想這個辦法的人是壞消息:你付的繁中溢價,不是繁體字造成的。它的中文合併規則本來就少,繁體簡體一起少,所以換字換不掉。

換算成錢更清楚。Claude Sonnet 5 每一萬個中文字的輸入成本,從 $0.0344 降到 $0.0331,省了 0.13 美分。同一份文字送去 Gemini 3.1 Pro,牌價一樣是 $2,繁體就只要 $0.0233。

連用詞一起換,多數再省 1%,Claude 反而變貴

上面用的是純字形轉換,「網路」變成「网路」,台灣的用詞保留著。另一種轉法是連詞彙一起換成大陸的說法,「網路」變成「网络」、「軟體」變成「软件」。

Tokenizer 繁體 簡體字形 +簡體用詞 用詞再省
Gemini 1.165 1.117 1.104 −1.1%
DeepSeek 1.108 1.024 1.013 −1.0%
OpenAI o200k_base 1.304 1.169 1.156 −1.0%
GLM 1.324 1.041 1.029 −0.9%
MiniMax 1.096 0.951 0.942 −0.8%
Qwen 1.219 1.117 1.112 −0.4%
Anthropic 5 世代 1.720 1.656 1.662 +0.4%
Anthropic 4.6 以前 1.650 1.586 1.593 +0.4%

字形轉換用 OpenCC 的 t2s,字形加用詞用 tw2sp。量測於 2026-08-13。

六家再省不到 1%,兩家反而變貴。Anthropic 的合併規則跟大陸慣用詞對不上,換過去之後 token 反而多了 0.4%。

這一欄的實務結論是:不要為了省 token 去改寫用詞。多出來的 1% 換來的是一份沒人想校對的文件,而且有兩家還會倒扣。

你的文件越中文,省得越多,但不成正比

只有中文字會變,所以中文佔比低的文件本來就沒什麼可省。拿折扣最大與最小的兩家,逐文體看:

文體 中文佔比 GLM 省下 Anthropic 5 省下
商業報告 90% −27.8% −4.0%
對話 prompt 74% −31.2% −6.9%
技術長文 66% −24.1% −4.1%
技術表格 29% −13.8% −3.0%
中英夾雜程式碼 17% −10.8% −1.6%

依中文佔比排序。量測於 2026-08-13。

方向對,但不是單調的:74% 那列的折扣比 90% 那列還大,兩家都是。所以「中文越多省越多」只能當方向感,不能當公式。

要估自己的檔案省多少,最上面那張表的比例只是起點,真正的數字要拿自己的文件量。

換字最多省 21%,換家最多省 36%

這是決定要不要做這件事的關鍵對照。

模型 Tokenizer 牌價 $/MTok 繁體 $ 簡體 $ 省下
DeepSeek-V4-Flash DeepSeek 0.14 0.0016 0.0014 −7.6%
GPT-5.6 Luna OpenAI 0.20 0.0026 0.0023 −10.4%
Gemini 3.1 Flash-Lite Gemini 0.25 0.0029 0.0028 −4.1%
MiniMax-M2.7 MiniMax 0.30 0.0033 0.0029 −13.2%
GLM-4.7 GLM 0.60 0.0079 0.0062 −21.4%
Claude Haiku 4.5 Anthropic 舊 1.00 0.0165 0.0159 −3.9%
Claude Sonnet 5 Anthropic 5 2.00 0.0344 0.0331 −3.7%

每一萬個中文字的輸入成本,牌價見價格對照表。量測於 2026-08-13。

換字最多省 21.4%。而同一份繁體文字從 Anthropic 5 世代搬到 MiniMax,token 直接少 36.3%,什麼都不用改寫。

也就是說,換一家的效果比換一種字大,而且不用動到你的內容。如果那份 prompt 每次都重送,快取的折扣還會再大一個量級,那才是該先做的事。

轉回繁體會掉字,回程設定用錯差 8 倍

省下來的錢只有在轉換可逆的時候才算數。而繁轉簡是多對一的:「後」和「后」都變成「后」,轉回去的時候就得猜。

回程設定 還原不回來 佔語料 最常見的錯誤
s2t(預設) 157 字 1.05% 為→爲、裡→裏、才→纔
s2tw(台灣) 20 字 0.13% 台→臺、布→佈、回→迴

繁轉簡再轉回繁,逐字比對原文。量測於 2026-08-13。

差了 7.8 倍,而差別只在回程那一行設定。用預設的 s2t 會把文件變成「爲了在這裏」,讀起來像簡轉繁的盜版電子書;用 s2tw 只剩下 20 個真正有歧義的字。

反過來,去程用哪個設定幾乎沒差。t2s 與 tw2s 在這份語料上只差 13 個字,token 數差 0.0007。要花心思的是回程,不是去程。

什麼情況值得轉,什麼情況不值得

值得的條件要同時成立三個:那份中文是固定重送的(RAG 的知識片段、system prompt 裡的參考資料)、沒有人會讀到它(所以不必轉回來)、而且你用的是折扣大的那幾家。GLM 上的一份長期固定的中文知識庫,21% 是實打實的。

不值得的情況比較多。使用者輸入是即時的,轉換要多一道;要交回給人看的內容得轉回來,就要吃那 0.13% 的損耗;在 Claude 或 Gemini 上折扣只有 4% 上下,不夠付這些麻煩。

還有一個沒量到但會吃掉折扣的風險:你送簡體進去,模型很可能就用簡體回你。輸出單價是輸入的 5 到 6 倍,為了省輸入的 10% 而讓輸出跑錯字體,帳算不過來。要做就得在 prompt 裡把輸出語言釘死,並且驗過真的有效。

今天可以做的一件事

挑你最常重送的那份中文,跑一次 opencc -c t2s,把前後兩份都丟給你在用的模型數 token。差距如果在 5% 以下就別做了,去看換一家能省多少;如果超過 15%,那份文件又沒人會讀,才值得往下想產線怎麼接。

這些數字量了什麼、沒量什麼

語料與方法跟上一篇同一份:14,951 個繁中字、五種文體、全部取自這個站自己的內容,所以可以隨程式碼公開重跑。轉換用 OpenCC,字形轉換走 t2s、字形加用詞走 tw2sp。

Anthropic、Google、OpenAI 的數字來自各家官方的計數端點,答的是實際在賣的模型;DeepSeek、Qwen、GLM、MiniMax 是離線讀 Hugging Face 上的 tokenizer.json,其中只有 GLM-4.6 是精確對應,其餘是從開放權重版本推及到同廠的 API 型號。

三個沒量的

  • 輸出完全沒量。 這裡的每個數字都只是輸入側。輸出更貴、也沒有快取折扣可用
  • 品質沒量。 換一種字寫同一件事,模型的回答會不會變差,這篇不處理
  • 只有一份語料。 五個文體各一份文本,換別的文件比例會動。tokenization 是確定性的,所以要強化結論該做的是換更多文本,不是重跑同一份

品質那條有人做過。FAccT ’25 上一篇羅徹斯特大學的研究審了 11 個模型在簡繁兩種提示下的表現,發現差異依任務而異,並把 tokenization 列為可能成因之一。也就是說換字這件事不只影響帳單,還可能影響答案,這是把它排進產線之前該自己驗一次的理由。

資料來源

  1. OpenCC 開放中文轉換(轉換設定的定義來源)
  2. Lyu et al., Characterizing Bias:簡繁中文的 LLM 表現差異(FAccT '25)
  3. Breeze-7B 技術報告:擴充詞表對繁中壓縮率的影響
  4. GLM-4.6 tokenizer(Hugging Face)
  5. MiniMax-M2 tokenizer(Hugging Face)
  6. Anthropic 官方 token counting 文件