繁體中文比簡體貴多少?八個 tokenizer 實測 3.7% 到 21%
把同一份繁體文件轉成簡體再送給模型,token 數會少 3.7% 到 21%,八個 tokenizer 全部往下走。但幅度差 5.8 倍,而且省最多的那家因此換了名次。這篇量的是省多少、什麼情況值得省,以及轉回繁體會掉幾個字。
目錄(12 節)
價格更新(2026-08-25):下表 DeepSeek-V4-Flash 那一列的 $0.14 是 2026-08-13 量測當下的牌價。DeepSeek 已於 8 月下旬調價並實施尖離峰定價,現在是離峰 $0.22、尖峰 $0.44。這篇量的是 tokenizer 的字數差異,換算成錢的那兩欄會隨牌價走,現行價見價格對照表。
把同一份繁體中文文件轉成簡體再送給模型,token 數立刻少 3.7% 到 21%。
八個 tokenizer 量下來全部往下走,沒有一家例外。但幅度差很多:省最多的那家是省最少的 5.8 倍,而且它因為這個差距,在「誰比較便宜」的排名上跳了三名。
這是上一篇量 23 個模型留下來的問題。那篇的結論是各家的中文成本差異來自訓練語料的組成,不是來自中文這個語言。如果真是這樣,而語料裡的中文又以簡體居多,那把繁體換成簡體就應該會便宜。
確實會。但便宜的幅度,多數情況下不夠你把一條產線改掉。
八家全部變便宜,但幅度差 5.8 倍
同一份 14,951 字的繁中語料,用 OpenCC 轉成簡體字形之後重新計算。
| Tokenizer | 繁體 | 簡體字形 | 省下 | 量法 |
|---|---|---|---|---|
| GLM | 1.324 | 1.041 | −21.4% | 開放權重・精確 |
| MiniMax | 1.096 | 0.951 | −13.2% | 開放權重・推及 |
OpenAI o200k_base |
1.304 | 1.169 | −10.4% | API |
| Qwen | 1.219 | 1.117 | −8.4% | 開放權重・推及 |
| DeepSeek | 1.108 | 1.024 | −7.6% | 開放權重・推及 |
| Gemini | 1.165 | 1.117 | −4.1% | API |
| Anthropic 4.6 以前 | 1.650 | 1.586 | −3.9% | API |
| Anthropic 5 世代 | 1.720 | 1.656 | −3.7% | API |
每個中文字平均切成幾個 token。量測於 2026-08-13。
值得先講清楚的是,這個折扣不是全文打折來的。繁轉簡實際動到的字只有 4,695 個,佔語料的 31%。其餘三分之二的字兩邊長得一模一樣,完全沒有變化的空間。
所以 GLM 那個 21.4%,是全部集中在三成的字上換來的。那三成字在繁體型態下被切得有多零碎,這個數字就有多大。
GLM 不是貴,是沒有為繁體調過
上一篇的表裡,GLM 是全場最貴的中文 tokenizer,1.324,比 OpenAI 還高。當時的解讀是它英文與程式碼的效率較差。換成簡體之後,那個解讀要修正。
| 名次 | 繁體最省 | 簡體最省 | 變化 |
|---|---|---|---|
| 1 | MiniMax 1.096 | MiniMax 0.951 | 不變 |
| 2 | DeepSeek 1.108 | DeepSeek 1.024 | 不變 |
| 3 | Gemini 1.165 | GLM 1.041 | ↑ 3 |
| 4 | Qwen 1.219 | Gemini 1.117 | ↓ 1 |
| 5 | OpenAI o200k_base 1.304 |
Qwen 1.117 | ↓ 1 |
| 6 | GLM 1.324 | OpenAI o200k_base 1.169 |
↓ 1 |
| 7 | Anthropic 4.6 以前 1.650 | Anthropic 4.6 以前 1.586 | 不變 |
| 8 | Anthropic 5 世代 1.720 | Anthropic 5 世代 1.656 | 不變 |
同樣八個 tokenizer,各自用兩種字排一次。量測於 2026-08-13。
GLM 從第六名跳到第三名。它處理中文一點問題也沒有,它只是沒有把繁體字收進高頻的合併規則裡。對一個主要服務簡體市場的模型來說,這是完全合理的取捨,只是這個取捨的帳單會出現在台灣團隊身上。
這也說明這件事是可以修的,而且有人修過。Breeze-7B 的技術報告記載他們在 Mistral 的詞表上加了 29,873 個 token、擴到 61,872 個,繁中語料的壓縮率因此變成原本的兩倍左右。詞表補上去,稅就不見了。
差別在於那是自己訓練模型才有的選項。用 API 的人動不了詞表,只能動送進去的字。
Claude 幾乎不動,最貴的還是最貴
排名表最下面兩列從頭到尾沒動過。Anthropic 兩個世代的折扣是 3.9% 與 3.7%,是全場最小的兩個。
這對正在用 Claude 又在想這個辦法的人是壞消息:你付的繁中溢價,不是繁體字造成的。它的中文合併規則本來就少,繁體簡體一起少,所以換字換不掉。
換算成錢更清楚。Claude Sonnet 5 每一萬個中文字的輸入成本,從 $0.0344 降到 $0.0331,省了 0.13 美分。同一份文字送去 Gemini 3.1 Pro,牌價一樣是 $2,繁體就只要 $0.0233。
連用詞一起換,多數再省 1%,Claude 反而變貴
上面用的是純字形轉換,「網路」變成「网路」,台灣的用詞保留著。另一種轉法是連詞彙一起換成大陸的說法,「網路」變成「网络」、「軟體」變成「软件」。
| Tokenizer | 繁體 | 簡體字形 | +簡體用詞 | 用詞再省 |
|---|---|---|---|---|
| Gemini | 1.165 | 1.117 | 1.104 | −1.1% |
| DeepSeek | 1.108 | 1.024 | 1.013 | −1.0% |
OpenAI o200k_base |
1.304 | 1.169 | 1.156 | −1.0% |
| GLM | 1.324 | 1.041 | 1.029 | −0.9% |
| MiniMax | 1.096 | 0.951 | 0.942 | −0.8% |
| Qwen | 1.219 | 1.117 | 1.112 | −0.4% |
| Anthropic 5 世代 | 1.720 | 1.656 | 1.662 | +0.4% |
| Anthropic 4.6 以前 | 1.650 | 1.586 | 1.593 | +0.4% |
字形轉換用 OpenCC 的 t2s,字形加用詞用 tw2sp。量測於 2026-08-13。
六家再省不到 1%,兩家反而變貴。Anthropic 的合併規則跟大陸慣用詞對不上,換過去之後 token 反而多了 0.4%。
這一欄的實務結論是:不要為了省 token 去改寫用詞。多出來的 1% 換來的是一份沒人想校對的文件,而且有兩家還會倒扣。
你的文件越中文,省得越多,但不成正比
只有中文字會變,所以中文佔比低的文件本來就沒什麼可省。拿折扣最大與最小的兩家,逐文體看:
| 文體 | 中文佔比 | GLM 省下 | Anthropic 5 省下 |
|---|---|---|---|
| 商業報告 | 90% | −27.8% | −4.0% |
| 對話 prompt | 74% | −31.2% | −6.9% |
| 技術長文 | 66% | −24.1% | −4.1% |
| 技術表格 | 29% | −13.8% | −3.0% |
| 中英夾雜程式碼 | 17% | −10.8% | −1.6% |
依中文佔比排序。量測於 2026-08-13。
方向對,但不是單調的:74% 那列的折扣比 90% 那列還大,兩家都是。所以「中文越多省越多」只能當方向感,不能當公式。
要估自己的檔案省多少,最上面那張表的比例只是起點,真正的數字要拿自己的文件量。
換字最多省 21%,換家最多省 36%
這是決定要不要做這件事的關鍵對照。
| 模型 | Tokenizer | 牌價 $/MTok | 繁體 $ | 簡體 $ | 省下 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash | DeepSeek | 0.14 | 0.0016 | 0.0014 | −7.6% |
| GPT-5.6 Luna | OpenAI | 0.20 | 0.0026 | 0.0023 | −10.4% |
| Gemini 3.1 Flash-Lite | Gemini | 0.25 | 0.0029 | 0.0028 | −4.1% |
| MiniMax-M2.7 | MiniMax | 0.30 | 0.0033 | 0.0029 | −13.2% |
| GLM-4.7 | GLM | 0.60 | 0.0079 | 0.0062 | −21.4% |
| Claude Haiku 4.5 | Anthropic 舊 | 1.00 | 0.0165 | 0.0159 | −3.9% |
| Claude Sonnet 5 | Anthropic 5 | 2.00 | 0.0344 | 0.0331 | −3.7% |
每一萬個中文字的輸入成本,牌價見價格對照表。量測於 2026-08-13。
換字最多省 21.4%。而同一份繁體文字從 Anthropic 5 世代搬到 MiniMax,token 直接少 36.3%,什麼都不用改寫。
也就是說,換一家的效果比換一種字大,而且不用動到你的內容。如果那份 prompt 每次都重送,快取的折扣還會再大一個量級,那才是該先做的事。
轉回繁體會掉字,回程設定用錯差 8 倍
省下來的錢只有在轉換可逆的時候才算數。而繁轉簡是多對一的:「後」和「后」都變成「后」,轉回去的時候就得猜。
| 回程設定 | 還原不回來 | 佔語料 | 最常見的錯誤 |
|---|---|---|---|
s2t(預設) |
157 字 | 1.05% | 為→爲、裡→裏、才→纔 |
s2tw(台灣) |
20 字 | 0.13% | 台→臺、布→佈、回→迴 |
繁轉簡再轉回繁,逐字比對原文。量測於 2026-08-13。
差了 7.8 倍,而差別只在回程那一行設定。用預設的 s2t 會把文件變成「爲了在這裏」,讀起來像簡轉繁的盜版電子書;用 s2tw 只剩下 20 個真正有歧義的字。
反過來,去程用哪個設定幾乎沒差。t2s 與 tw2s 在這份語料上只差 13 個字,token 數差 0.0007。要花心思的是回程,不是去程。
什麼情況值得轉,什麼情況不值得
值得的條件要同時成立三個:那份中文是固定重送的(RAG 的知識片段、system prompt 裡的參考資料)、沒有人會讀到它(所以不必轉回來)、而且你用的是折扣大的那幾家。GLM 上的一份長期固定的中文知識庫,21% 是實打實的。
不值得的情況比較多。使用者輸入是即時的,轉換要多一道;要交回給人看的內容得轉回來,就要吃那 0.13% 的損耗;在 Claude 或 Gemini 上折扣只有 4% 上下,不夠付這些麻煩。
還有一個沒量到但會吃掉折扣的風險:你送簡體進去,模型很可能就用簡體回你。輸出單價是輸入的 5 到 6 倍,為了省輸入的 10% 而讓輸出跑錯字體,帳算不過來。要做就得在 prompt 裡把輸出語言釘死,並且驗過真的有效。
今天可以做的一件事
挑你最常重送的那份中文,跑一次 opencc -c t2s,把前後兩份都丟給你在用的模型數 token。差距如果在 5% 以下就別做了,去看換一家能省多少;如果超過 15%,那份文件又沒人會讀,才值得往下想產線怎麼接。
這些數字量了什麼、沒量什麼
語料與方法跟上一篇同一份:14,951 個繁中字、五種文體、全部取自這個站自己的內容,所以可以隨程式碼公開重跑。轉換用 OpenCC,字形轉換走 t2s、字形加用詞走 tw2sp。
Anthropic、Google、OpenAI 的數字來自各家官方的計數端點,答的是實際在賣的模型;DeepSeek、Qwen、GLM、MiniMax 是離線讀 Hugging Face 上的 tokenizer.json,其中只有 GLM-4.6 是精確對應,其餘是從開放權重版本推及到同廠的 API 型號。
三個沒量的
- 輸出完全沒量。 這裡的每個數字都只是輸入側。輸出更貴、也沒有快取折扣可用
- 品質沒量。 換一種字寫同一件事,模型的回答會不會變差,這篇不處理
- 只有一份語料。 五個文體各一份文本,換別的文件比例會動。tokenization 是確定性的,所以要強化結論該做的是換更多文本,不是重跑同一份
品質那條有人做過。FAccT ’25 上一篇羅徹斯特大學的研究審了 11 個模型在簡繁兩種提示下的表現,發現差異依任務而異,並把 tokenization 列為可能成因之一。也就是說換字這件事不只影響帳單,還可能影響答案,這是把它排進產線之前該自己驗一次的理由。