Pick Model

成本分析

中文一個字要幾個 token?23 個模型的實測與成本對照

網路上到處寫著「中文一個字約 1.5 到 2 個 token」。實測 23 個現役模型,純中文的比例落在 0.72 到 1.17 之間,沒有一家超過 1.2。而牌價相同的模型之間,帳單最多差 48%。

目錄(12 節)
  1. 0.72 到 1.17,看你用哪一家
  2. 牌價一樣的時候,差的全部是 tokenizer
  3. 中國廠商不是一律比較省,GLM 就比 OpenAI 貴
  4. 一家一個 tokenizer,換型號改不掉
  5. 差距多大要看你的內容,48% 到 61% 都有
  6. 你的 1M context 裝不下 100 萬中文字
  7. 別用網路上的 token 計算機估 Claude
  8. 今天可以做的一件事
  9. 這些數字量了什麼、沒量什麼
  10. 兩種量法,證據強度不一樣
  11. 其他四個限制
  12. 資料來源

搜尋「中文 token」,最常看到的答案是「一個中文字大約 1.5 到 2 個 token」。

這個數字對 2026 年的現役模型已經不成立。我拿同一份 14,951 字的繁體中文語料,量了 23 個現在還在賣的模型,純中文內容的比例落在 0.72 到 1.17 之間,沒有一家超過 1.2。最省的那家,一個中文字連一個 token 都用不到。

差距沒有消失,只是搬家了。它不再是「中文比英文貴多少」,而是「你選了哪一家」。牌價同樣是 $2 / 1M tokens 的三個模型,跑同一份文件,帳單差 48%。

0.72 到 1.17,看你用哪一家

先把答案放上來。「混合語料」是五種文體加總,比較貼近真實工作負載;「90% 純中文」那欄只有商業報告那份,中文濃度最高,最接近「一個中文字幾個 token」這個問題的字面意思。

Tokenizer 混合語料 90% 純中文 對比最省
MiniMax 1.096 0.734 基準
DeepSeek 1.108 0.723 +1%
Gemini 1.165 0.782 +6%
Qwen 1.219 0.777 +11%
OpenAI o200k_base 1.304 0.952 +19%
GLM 1.324 0.914 +21%
Anthropic 4.6 以前 1.650 1.165 +51%
Anthropic 4.7 起 1.720 1.166 +57%

量測於 2026-08-12。語料 14,951 繁中字 / 28,391 字元。

一個中文字切不到一個 token,聽起來反直覺,但它只是說 tokenizer 把常見的中文詞合併掉了。「因為」「系統」「使用者」這種高頻詞會變成單一個 token,兩三個字才算一個。

要注意的是這兩欄不能混用。「混合語料」那欄裡面含了表格的管線符號、程式碼裡的英文、數字與標點,那些你也要付錢,所以報成本要看它。「90% 純中文」是拿來回答語言問題的,不是拿來估帳單的。

牌價一樣的時候,差的全部是 tokenizer

比例本身不是錢。要看到錢,把牌價固定住,$/MTok 這個變數就消掉了,剩下唯一還在動的東西是「這段文字被切成幾個 token」。

模型 Tokenizer Tokens 每萬字 $
Gemini 3.1 Pro Gemini 11,647 0.0233
GPT-5.6 Terra OpenAI 13,041 0.0261
Claude Sonnet 5 Anthropic 5 17,198 0.0344

三個模型的輸入牌價都是 $2 / 1M tokens。每 10,000 個繁中字的輸入成本,量測於 2026-08-12,牌價見價格對照表。

價差 47.7%。這裡沒有「但是它比較聰明」的空間,因為比的不是產出品質,是同一份輸入被計費成幾個 token。

同樣的對照在其他價格帶也成立:$5 那組 GPT-5.6 Sol 對 Claude Opus 5 差 32%,$1 那組 GLM-5 對 Claude Haiku 4.5 差 25%。牌價越接近,tokenizer 的影響佔比越高,因為它是唯一沒被抵銷掉的變數。

中國廠商不是一律比較省,GLM 就比 OpenAI 貴

常見的說法是「中文模型對中文比較友善」。這句話一半對。

DeepSeek 和 MiniMax 確實是全場最省的兩家,比 Gemini 還省。但 GLM 在混合語料上比 OpenAI 還貴(1.324 對 1.304),Qwen 也只排在 Gemini 後面。把它們當成一個群體去推論會推錯。

原因在於決定這件事的不是公司國籍,是訓練語料的組成。BPE 這類 tokenizer 的合併規則純粹由語料統計決定:某個字元組合出現得夠多,就被合併成一個 token。中文語料佔比高的模型,中文詞被合併得多,比例就低。這是統計結果,不是語言特性,跨語言 tokenization 的公平性研究在更多語言上量到同樣的模式。

GLM 的位置也解釋得通:它在 90% 純中文那欄是 0.914,贏過 OpenAI 的 0.952;輸的是混合語料那欄。它處理中文沒問題,是處理英文與程式碼的效率比較差,而混合語料裡有將近一半不是中文。

一家一個 tokenizer,換型號改不掉

23 個模型量下來,比例收斂成上表那 8 種(Anthropic 4.7 與 5 世代逐檔比對其實差 2 個 token,成本上可以無視,上表併成一列)。同一家廠商的整條產品線共用同一個 tokenizer,從最便宜的 flash 到最貴的旗艦完全一樣。

這件事的實務含義比表面上大。tokenizer 是廠商層級的選擇,不是型號層級的選擇。 在同一家裡面從旗艦換到便宜型號,省的是牌價,token 數一個都不會少。要動到 token 數只有換家。

唯一的例外在 Anthropic:它是唯一產品線上跨兩個 tokenizer 的廠商,Haiku 4.5 還在舊的那套,4.7 之後的型號用新的。順帶一提,官方對這個變更給了兩個數字,發布公告寫「roughly 1.0–1.35× depending on the content type」,官方的 token counting 文件則直接寫 30%。實測繁體中文只差 4%,那個 30% 屬於英文與程式碼那一端。

差距多大要看你的內容,48% 到 61% 都有

上面那些比例是拿混合語料算的。你的 prompt 不長那樣,所以差距也不會剛好是那個數字。

拿最省的 MiniMax 對最貴的 Anthropic 5 世代,同一組對照在五種文體上:

文體 中文佔比 MiniMax Anthropic 5 差距
商業報告 90% 0.734 1.166 +59%
對話 prompt 74% 0.867 1.391 +61%
技術長文 66% 0.947 1.502 +59%
技術表格 29% 1.878 2.912 +55%
中英夾雜程式碼 17% 2.342 3.465 +48%

每個中文字平均切成幾個 token,依中文佔比排序。量測於 2026-08-12。

方向很清楚:中英夾雜得越多,各家差距越小,因為英文那部分大家切得差不多。但它不是單調的,74% 那列比 90% 那列差距還大,所以不要拿「中文越多差越多」當公式用。

能拿來用的結論只有一條:差距在你的內容上不會消失,但也不會剛好等於表上的數字,要準就拿自己的檔案量一次。

你的 1M context 裝不下 100 萬中文字

同一個比例不只出現在帳單上。Context window 是用 token 計的,換算成中文字之後,各家的實際容量差很多。

模型 標示 context 實際裝得下的繁中字
MiniMax-M3 1,000,000 912,147
DeepSeek-V4-Flash 1,000,000 902,402
Gemini 3.1 Flash-Lite 1,048,576 900,268
GPT-5.6 Luna 1,050,000 805,178
Claude Sonnet 5 1,000,000 581,479
Claude Haiku 4.5 200,000 121,208

官方標示的 context window 除以該 tokenizer 的實測比例,量測於 2026-08-12。

五個都宣稱百萬 token 窗口的模型,實際裝得下的中文字從 58 萬到 91 萬,差 57%。規劃 RAG 要塞多少文件、或判斷一份長報告塞不塞得進去的時候,看標示的那個數字會高估,而且高估的幅度依廠商而異。

同一個乘數還會推到第三個地方:輸出。同一段中文在 token 數多的模型上算更多 token,所以撞到輸出上限的位置也更早。

別用網路上的 token 計算機估 Claude

Anthropic 沒有公開可離線跑的 tokenizer,所以多數第三方 token 計算機不管你選哪家模型,底下跑的都是 OpenAI 的那一套。用它估中文的 Claude prompt 會系統性地少算,在這份語料上少了 21% 到 24%。

少算 24% 的意思是,你以為塞得進 context 的文件其實塞不進去,估出來的月成本要再往上加四分之一。

要準就打官方端點。Anthropic 的 count tokens 是免費的,而且限流跟正式請求分開算,不會排擠到你的產線;Google 與 OpenAI 也各有對應的計數方式。

今天可以做的一件事

挑一份你真的會反覆送的東西,system prompt 或 RAG 的知識庫片段都好,丟給你現在在用的模型和你在考慮的那個,比兩個 input_tokens。乘上牌價再乘上你一個月送幾次,就是換家能省下的實際金額。

數完之後還有兩件事值得順手看:這份 prompt 有多少比例是每次都一樣的(那部分該吃快取,折扣幅度遠大於這裡談的 48%),以及模型會回多長(話多的模型帳單反而更貴,輸出單價是輸入的 5 到 6 倍)。

這些數字量了什麼、沒量什麼

語料全部取自這個站自己的內容,所以可以隨程式碼一起公開,任何人都能重跑。五種文體是刻意湊出不同的中文佔比,因為差距隨中文佔比變化,只用一種文體會看不到這件事。

文體 來源 繁中字 中文佔比
技術長文 五篇已發布文章的內文 11,524 66%
技術表格 同上,只取表格列 1,427 29%
商業報告 手寫,跟主管報告的口吻 685 90%
對話 prompt 手寫,跟 agent 對話的口吻 532 74%
中英夾雜程式碼 本專案腳本裡含中文的行 783 17%

合計 14,951 繁中字 / 28,391 字元。

兩種量法,證據強度不一樣

Anthropic、Google、OpenAI 走官方 API,答的是實際在賣的那顆模型。DeepSeek、Qwen、GLM、MiniMax 是離線讀 Hugging Face 上的 tokenizer.json,其中只有 GLM-4.6 是精確對應(那顆本來就在價格表上),其餘是從開放權重版本推及到同廠的 API 型號,未經廠商確認。Moonshot 沒有進表,因為它唯一拿得到 tokenizer 的公開 repo 是基於 Qwen 的衍生模型,量出來會是 Qwen 的數字掛在 Moonshot 名下。

其他四個限制

  • 只有輸入。 輸出沒量。輸出單價通常是輸入的 5 到 6 倍,也沒有快取折扣可用,所以真實帳單的比例會跟這裡不同
  • 沒有算快取。 重複送的前綴可以打到一折左右,這裡是完全沒有快取的裸價
  • 每個文體只有一份文本。 五個點各是單一樣本。要強化結論該做的是換更多文本,不是重跑同一份。tokenization 是確定性的,同一段文字每次切出來都一樣
  • 兩份手寫語料帶有作者的用字習慣,不是隨機抽樣的台灣書面語

前人做過同一件事:ihower 在 2024 年用約 8 萬繁中字對比過八家,方法論可以直接借。那份停在 GPT-4o 與 Llama 3 的世代,2026 年的現役模型全部沒有覆蓋,這是重跑一次的理由。

資料來源

  1. Anthropic 官方 token counting 文件(含 4.7 起 tokenizer 變更說明)
  2. Anthropic 官方 Claude Opus 4.7 發布公告
  3. ihower:使用繁體中文評測各家 LLM Tokenizer 分詞器
  4. Petrov et al.:跨語言 tokenization 的公平性研究
  5. DeepSeek-V3.2-Exp tokenizer(Hugging Face)
  6. Qwen3-235B-A22B tokenizer(Hugging Face)
  7. GLM-4.6 tokenizer(Hugging Face)
  8. MiniMax-M2 tokenizer(Hugging Face)