中文一個字要幾個 token?23 個模型的實測與成本對照
網路上到處寫著「中文一個字約 1.5 到 2 個 token」。實測 23 個現役模型,純中文的比例落在 0.72 到 1.17 之間,沒有一家超過 1.2。而牌價相同的模型之間,帳單最多差 48%。
目錄(12 節)
搜尋「中文 token」,最常看到的答案是「一個中文字大約 1.5 到 2 個 token」。
這個數字對 2026 年的現役模型已經不成立。我拿同一份 14,951 字的繁體中文語料,量了 23 個現在還在賣的模型,純中文內容的比例落在 0.72 到 1.17 之間,沒有一家超過 1.2。最省的那家,一個中文字連一個 token 都用不到。
差距沒有消失,只是搬家了。它不再是「中文比英文貴多少」,而是「你選了哪一家」。牌價同樣是 $2 / 1M tokens 的三個模型,跑同一份文件,帳單差 48%。
0.72 到 1.17,看你用哪一家
先把答案放上來。「混合語料」是五種文體加總,比較貼近真實工作負載;「90% 純中文」那欄只有商業報告那份,中文濃度最高,最接近「一個中文字幾個 token」這個問題的字面意思。
| Tokenizer | 混合語料 | 90% 純中文 | 對比最省 |
|---|---|---|---|
| MiniMax | 1.096 | 0.734 | 基準 |
| DeepSeek | 1.108 | 0.723 | +1% |
| Gemini | 1.165 | 0.782 | +6% |
| Qwen | 1.219 | 0.777 | +11% |
OpenAI o200k_base |
1.304 | 0.952 | +19% |
| GLM | 1.324 | 0.914 | +21% |
| Anthropic 4.6 以前 | 1.650 | 1.165 | +51% |
| Anthropic 4.7 起 | 1.720 | 1.166 | +57% |
量測於 2026-08-12。語料 14,951 繁中字 / 28,391 字元。
一個中文字切不到一個 token,聽起來反直覺,但它只是說 tokenizer 把常見的中文詞合併掉了。「因為」「系統」「使用者」這種高頻詞會變成單一個 token,兩三個字才算一個。
要注意的是這兩欄不能混用。「混合語料」那欄裡面含了表格的管線符號、程式碼裡的英文、數字與標點,那些你也要付錢,所以報成本要看它。「90% 純中文」是拿來回答語言問題的,不是拿來估帳單的。
牌價一樣的時候,差的全部是 tokenizer
比例本身不是錢。要看到錢,把牌價固定住,$/MTok 這個變數就消掉了,剩下唯一還在動的東西是「這段文字被切成幾個 token」。
| 模型 | Tokenizer | Tokens | 每萬字 $ |
|---|---|---|---|
| Gemini 3.1 Pro | Gemini | 11,647 | 0.0233 |
| GPT-5.6 Terra | OpenAI | 13,041 | 0.0261 |
| Claude Sonnet 5 | Anthropic 5 | 17,198 | 0.0344 |
三個模型的輸入牌價都是 $2 / 1M tokens。每 10,000 個繁中字的輸入成本,量測於 2026-08-12,牌價見價格對照表。
價差 47.7%。這裡沒有「但是它比較聰明」的空間,因為比的不是產出品質,是同一份輸入被計費成幾個 token。
同樣的對照在其他價格帶也成立:$5 那組 GPT-5.6 Sol 對 Claude Opus 5 差 32%,$1 那組 GLM-5 對 Claude Haiku 4.5 差 25%。牌價越接近,tokenizer 的影響佔比越高,因為它是唯一沒被抵銷掉的變數。
中國廠商不是一律比較省,GLM 就比 OpenAI 貴
常見的說法是「中文模型對中文比較友善」。這句話一半對。
DeepSeek 和 MiniMax 確實是全場最省的兩家,比 Gemini 還省。但 GLM 在混合語料上比 OpenAI 還貴(1.324 對 1.304),Qwen 也只排在 Gemini 後面。把它們當成一個群體去推論會推錯。
原因在於決定這件事的不是公司國籍,是訓練語料的組成。BPE 這類 tokenizer 的合併規則純粹由語料統計決定:某個字元組合出現得夠多,就被合併成一個 token。中文語料佔比高的模型,中文詞被合併得多,比例就低。這是統計結果,不是語言特性,跨語言 tokenization 的公平性研究在更多語言上量到同樣的模式。
GLM 的位置也解釋得通:它在 90% 純中文那欄是 0.914,贏過 OpenAI 的 0.952;輸的是混合語料那欄。它處理中文沒問題,是處理英文與程式碼的效率比較差,而混合語料裡有將近一半不是中文。
一家一個 tokenizer,換型號改不掉
23 個模型量下來,比例收斂成上表那 8 種(Anthropic 4.7 與 5 世代逐檔比對其實差 2 個 token,成本上可以無視,上表併成一列)。同一家廠商的整條產品線共用同一個 tokenizer,從最便宜的 flash 到最貴的旗艦完全一樣。
這件事的實務含義比表面上大。tokenizer 是廠商層級的選擇,不是型號層級的選擇。 在同一家裡面從旗艦換到便宜型號,省的是牌價,token 數一個都不會少。要動到 token 數只有換家。
唯一的例外在 Anthropic:它是唯一產品線上跨兩個 tokenizer 的廠商,Haiku 4.5 還在舊的那套,4.7 之後的型號用新的。順帶一提,官方對這個變更給了兩個數字,發布公告寫「roughly 1.0–1.35× depending on the content type」,官方的 token counting 文件則直接寫 30%。實測繁體中文只差 4%,那個 30% 屬於英文與程式碼那一端。
差距多大要看你的內容,48% 到 61% 都有
上面那些比例是拿混合語料算的。你的 prompt 不長那樣,所以差距也不會剛好是那個數字。
拿最省的 MiniMax 對最貴的 Anthropic 5 世代,同一組對照在五種文體上:
| 文體 | 中文佔比 | MiniMax | Anthropic 5 | 差距 |
|---|---|---|---|---|
| 商業報告 | 90% | 0.734 | 1.166 | +59% |
| 對話 prompt | 74% | 0.867 | 1.391 | +61% |
| 技術長文 | 66% | 0.947 | 1.502 | +59% |
| 技術表格 | 29% | 1.878 | 2.912 | +55% |
| 中英夾雜程式碼 | 17% | 2.342 | 3.465 | +48% |
每個中文字平均切成幾個 token,依中文佔比排序。量測於 2026-08-12。
方向很清楚:中英夾雜得越多,各家差距越小,因為英文那部分大家切得差不多。但它不是單調的,74% 那列比 90% 那列差距還大,所以不要拿「中文越多差越多」當公式用。
能拿來用的結論只有一條:差距在你的內容上不會消失,但也不會剛好等於表上的數字,要準就拿自己的檔案量一次。
你的 1M context 裝不下 100 萬中文字
同一個比例不只出現在帳單上。Context window 是用 token 計的,換算成中文字之後,各家的實際容量差很多。
| 模型 | 標示 context | 實際裝得下的繁中字 |
|---|---|---|
| MiniMax-M3 | 1,000,000 | 912,147 |
| DeepSeek-V4-Flash | 1,000,000 | 902,402 |
| Gemini 3.1 Flash-Lite | 1,048,576 | 900,268 |
| GPT-5.6 Luna | 1,050,000 | 805,178 |
| Claude Sonnet 5 | 1,000,000 | 581,479 |
| Claude Haiku 4.5 | 200,000 | 121,208 |
官方標示的 context window 除以該 tokenizer 的實測比例,量測於 2026-08-12。
五個都宣稱百萬 token 窗口的模型,實際裝得下的中文字從 58 萬到 91 萬,差 57%。規劃 RAG 要塞多少文件、或判斷一份長報告塞不塞得進去的時候,看標示的那個數字會高估,而且高估的幅度依廠商而異。
同一個乘數還會推到第三個地方:輸出。同一段中文在 token 數多的模型上算更多 token,所以撞到輸出上限的位置也更早。
別用網路上的 token 計算機估 Claude
Anthropic 沒有公開可離線跑的 tokenizer,所以多數第三方 token 計算機不管你選哪家模型,底下跑的都是 OpenAI 的那一套。用它估中文的 Claude prompt 會系統性地少算,在這份語料上少了 21% 到 24%。
少算 24% 的意思是,你以為塞得進 context 的文件其實塞不進去,估出來的月成本要再往上加四分之一。
要準就打官方端點。Anthropic 的 count tokens 是免費的,而且限流跟正式請求分開算,不會排擠到你的產線;Google 與 OpenAI 也各有對應的計數方式。
今天可以做的一件事
挑一份你真的會反覆送的東西,system prompt 或 RAG 的知識庫片段都好,丟給你現在在用的模型和你在考慮的那個,比兩個 input_tokens。乘上牌價再乘上你一個月送幾次,就是換家能省下的實際金額。
數完之後還有兩件事值得順手看:這份 prompt 有多少比例是每次都一樣的(那部分該吃快取,折扣幅度遠大於這裡談的 48%),以及模型會回多長(話多的模型帳單反而更貴,輸出單價是輸入的 5 到 6 倍)。
這些數字量了什麼、沒量什麼
語料全部取自這個站自己的內容,所以可以隨程式碼一起公開,任何人都能重跑。五種文體是刻意湊出不同的中文佔比,因為差距隨中文佔比變化,只用一種文體會看不到這件事。
| 文體 | 來源 | 繁中字 | 中文佔比 |
|---|---|---|---|
| 技術長文 | 五篇已發布文章的內文 | 11,524 | 66% |
| 技術表格 | 同上,只取表格列 | 1,427 | 29% |
| 商業報告 | 手寫,跟主管報告的口吻 | 685 | 90% |
| 對話 prompt | 手寫,跟 agent 對話的口吻 | 532 | 74% |
| 中英夾雜程式碼 | 本專案腳本裡含中文的行 | 783 | 17% |
合計 14,951 繁中字 / 28,391 字元。
兩種量法,證據強度不一樣
Anthropic、Google、OpenAI 走官方 API,答的是實際在賣的那顆模型。DeepSeek、Qwen、GLM、MiniMax 是離線讀 Hugging Face 上的 tokenizer.json,其中只有 GLM-4.6 是精確對應(那顆本來就在價格表上),其餘是從開放權重版本推及到同廠的 API 型號,未經廠商確認。Moonshot 沒有進表,因為它唯一拿得到 tokenizer 的公開 repo 是基於 Qwen 的衍生模型,量出來會是 Qwen 的數字掛在 Moonshot 名下。
其他四個限制
- 只有輸入。 輸出沒量。輸出單價通常是輸入的 5 到 6 倍,也沒有快取折扣可用,所以真實帳單的比例會跟這裡不同
- 沒有算快取。 重複送的前綴可以打到一折左右,這裡是完全沒有快取的裸價
- 每個文體只有一份文本。 五個點各是單一樣本。要強化結論該做的是換更多文本,不是重跑同一份。tokenization 是確定性的,同一段文字每次切出來都一樣
- 兩份手寫語料帶有作者的用字習慣,不是隨機抽樣的台灣書面語
前人做過同一件事:ihower 在 2024 年用約 8 萬繁中字對比過八家,方法論可以直接借。那份停在 GPT-4o 與 Llama 3 的世代,2026 年的現役模型全部沒有覆蓋,這是重跑一次的理由。
資料來源
- Anthropic 官方 token counting 文件(含 4.7 起 tokenizer 變更說明)
- Anthropic 官方 Claude Opus 4.7 發布公告
- ihower:使用繁體中文評測各家 LLM Tokenizer 分詞器
- Petrov et al.:跨語言 tokenization 的公平性研究
- DeepSeek-V3.2-Exp tokenizer(Hugging Face)
- Qwen3-235B-A22B tokenizer(Hugging Face)
- GLM-4.6 tokenizer(Hugging Face)
- MiniMax-M2 tokenizer(Hugging Face)