AI 模型 API 價格對照表
60 個現役模型的官方牌價,單位是每 1M tokens 的美金。 每一筆都附官方定價頁連結,數字看不順眼可以自己點進去對。
資料更新於 2026-08-03。空白處填 —,代表官方沒有公開那個數字。
看這張表之前要知道的三件事
- 這裡列的是牌價,不是你會付的價。多家廠商長期掛著限時或永久折扣,實際帳單可能只有一半。折扣狀況寫在各模型的備註裡。
- 單價低不等於帳單低。話多的模型會用掉更多輸出 token,把低單價的優勢吃光。 我們實測過一次,標榜便宜的模型帳單反而最貴。
- 牌價一樣不代表帳單一樣。各家的 tokenizer 把同一份中文文件切成的 token 數差很多。同樣是 $2 / 1M tokens 的 Gemini 3.1 Pro、GPT-5.6 Terra、Claude Sonnet 5,跑同一份繁體中文語料實測差 48%。
Anthropic
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
Claude Haiku 4.5claude-haiku-4-5用舊 tokenizer。 | $1 | $5 | $0.1 | 200K | 64K |
Claude Sonnet 5claude-sonnet-5$2 / $10 原為 introductory 價,官方已改列為標準價,原訂 2026-09-01 調到 $3 / $15 不會發生。Claude 4.7 起改用新 tokenizer,官方說同一段文字約 1.0–1.35 倍、依內容類型而定;本站實測繁體中文只多約 4%(純中文近乎持平),英文與程式碼才接近上限。 | $2 | $10 | $0.2 | 1M | 128K |
Claude Opus 5.5claude-opus-5-5cache read 為 base input 的 0.05x(其他 Claude 為 0.1x、Fable 5.1 為 0.025x)。1h cache write $8。Fast mode $8 / $40。1M context 全段標準價。Adaptive thinking 常開、預設 effort medium。知識截止 2026-06。tokenizer 實測與 Claude 5 世代逐格相同(2026-09-23 count_tokens API)。退役承諾不早於 2027-09-22;發布日該頁未標,填 null。 | $4 | $20 | $0.2 | 1M | 128K |
Claude Opus 5claude-opus-5Claude 4.7 起改用新 tokenizer,官方說同一段文字約 1.0–1.35 倍、依內容類型而定;本站實測繁體中文只多約 4%(純中文近乎持平),英文與程式碼才接近上限。 Fast mode 另計 $10 / $50。 | $5 | $25 | $0.5 | 1M | 128K |
Claude Fable 5.1claude-fable-5-1與 Claude Fable 5 同 tokenizer、同 context、同輸入輸出牌價,官方定價表上唯一的差別是快取讀取 $0.25(0.025 倍輸入價,Fable 5 為 $1.00 的 0.1 倍)。1 小時 cache write $20。無 Priority Tier,與 Fable 5 共用同一個速率限制池。 | $10 | $50 | $0.25 | 1M | 128K |
Claude Fable 5claude-fable-5Claude 4.7 起改用新 tokenizer,官方說同一段文字約 1.0–1.35 倍、依內容類型而定;本站實測繁體中文只多約 4%(純中文近乎持平),英文與程式碼才接近上限。 | $10 | $50 | $1 | 1M | 128K |
OpenAI
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
GPT-5 nanogpt-5-nano發布日取自 default snapshot 日期。 | $0.05 | $0.4 | $0.005 | 400K | 128K |
GPT-6 Lunagpt-6-luna階梯定價:>272K input tokens 該次請求全額改為 2x input/2x cache、1.5x output。Batch 與 Flex 為標準價的 0.5x。cache write 未查證(同代 astra/sol 皆為 1.25x input,此處不推及)。context window 1,050,000,max input tokens 922,000。知識截止 2026-05-18。推理檔位 none 到 max。tokenizer 實測 o200k_base(2026-09-23)。發布日該頁未標。 | $0.1 | $0.5 | $0.01 | 1.1M | 128K |
GPT-5.6 Lunagpt-5.6-luna發布日該頁未標。 | $0.2 | $1.2 | $0.02 | 1.1M | 128K |
GPT-5.4 nanogpt-5.4-nano發布日取自 default snapshot 日期。 | $0.2 | $1.25 | $0.02 | 400K | 128K |
GPT-5 minigpt-5-mini發布日取自 default snapshot `gpt-5-mini-2025-08-07`。 | $0.25 | $2 | $0.025 | 400K | 128K |
GPT-5.4 minigpt-5.4-mini發布日取自 default snapshot `gpt-5.4-mini-2026-03-17`。注意 context 只有 400K,跟 gpt-5.4 本體的 1.05M 不同。 | $0.75 | $4.5 | $0.075 | 400K | 128K |
GPT-5.1gpt-5.1發布日取自 default snapshot `gpt-5.1-2025-11-13`。 | $1.25 | $10 | $0.125 | 400K | 128K |
GPT-5gpt-5官方描述為「previous model」但未列入 deprecations,仍現役。發布日取自 default snapshot 日期。 | $1.25 | $10 | $0.125 | 400K | 128K |
GPT-5.2gpt-5.2發布日取自 default snapshot `gpt-5.2-2025-12-11`。 | $1.75 | $14 | $0.175 | 400K | 128K |
GPT-5.6 Terragpt-5.6-terra同 5.6 家族,>272K input 有 2x/1.5x 階梯(見 gpt-5.6-sol 頁)。發布日該頁未標。 | $2 | $12 | $0.2 | 1.1M | 128K |
o3o3o 系列中僅 o3 與 o3-pro 未被列入 deprecations;o1 / o1-pro / o3-mini / o4-mini 皆已 deprecated(2026-10-23 停用),依規則未收錄。發布日取自 default snapshot `o3-2025-04-16`。 | $2 | $8 | $0.5 | 200K | 100K |
GPT-6 Solgpt-6-sol階梯定價:>272K input tokens 該次請求全額改為 2x input/2x cache、1.5x output。Batch 與 Flex 為標準價的 0.5x,Fast mode 為 2x。cache write $2.50 = 1.25x 未快取 input。context window 1,050,000,max input tokens 922,000。知識截止 2026-04-20。推理檔位 none / low / medium(預設)/ high / xhigh / max;function calling 在 Chat Completions 只在 reasoning_effort=none 時可用。tokenizer 實測與 gpt-6-astra 逐格相同(o200k_base,2026-09-23 API+tiktoken 互證)。發布日該頁未標,填 null;第三方彙整稱 2026-09-22。 | $2 | $10 | $0.2 | 1.1M | 128K |
GPT-5.4gpt-5.4階梯定價:>272K input tokens 全 session 改 2x input、1.5x output。該頁未列 snapshot/發布日,故 null。 | $2.5 | $15 | $0.25 | 1.1M | 128K |
GPT-5.6 Solgpt-5.6-sol2026-09-05 實查:官方定價頁標為 promotional pricing $4 / $20(快取讀取 $0.4),字面是「at least through November 21, 2026」,恢復價未載明。本站 2026-08-04 實查時的牌價為 $5 / $30,price_expires_at 設在促銷截止日以強制複查。階梯定價:>272K input tokens 該次請求全額改為 2x input、1.5x output。此處填基礎階。context window 1,050,000,但同頁另註 max input tokens 為 922,000。cache write 官方只寫「1.25x 標準 input」未印金額,故填 null。snapshot / 發布日該頁未標,填 null。 | $4 | $20 | $0.4 | 1.1M | 128K |
GPT-5.5gpt-5.5階梯定價:>272K input tokens 全 session 改 2x input、1.5x output。發布日取自 default snapshot `gpt-5.5-2026-04-23`。另註:regional data residency endpoint 加收 10%。 | $5 | $30 | $0.5 | 1.1M | 128K |
GPT-6 Astragpt-6-astraGPT-6 世代目前官方定價頁上唯一的型號(無 mini / nano)。階梯定價:>272K input tokens 該次請求全額改為 2x input/2x cache、1.5x output。Batch 與 Flex 為標準價的 0.5x($5 / $25),Fast mode 為 2x($20 / $100)。cache write $12.50 = 1.25x 未快取 input。context window 1,050,000,同頁另註 max input tokens 為 922,000。知識截止 2026-04-30。推理檔位 low / medium / high / xhigh / max,沒有 none,同代的 gpt-5.6-sol 有 none。發布日該頁未標,填 null。 | $10 | $50 | $1 | 1.1M | 128K |
GPT-5 Progpt-5-promax output 272,000 明顯高於其他 GPT-5 家族(128K),已回頁面確認為官方寫法。無 cached input 價。 | $15 | $120 | — | 400K | 272K |
o3-proo3-pro發布日取自 default snapshot `o3-pro-2025-06-10`。無 cached input 價。 | $20 | $80 | — | 200K | 100K |
GPT-5.2 Progpt-5.2-pro發布日取自 default snapshot 日期。 | $21 | $168 | — | 400K | 128K |
GPT-5.5 Progpt-5.5-propro 系列不提供 cached input 價(官方表格為空)。發布日取自 default snapshot 日期。 | $30 | $180 | — | 1.1M | 128K |
GPT-5.4 Progpt-5.4-pro階梯定價:>272K input tokens 2x input、1.5x output。無 cached input 價。發布日取自 default snapshot 日期。 | $30 | $180 | — | 1.1M | 128K |
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
Gemini 2.5 Flash-Litegemini-2.5-flash-liteinput 為 text / image / video 價;audio input $0.30。cache read audio $0.03。cache storage $1.00 / 1M tokens / 小時。 | $0.1 | $0.4 | $0.01 | 1M | 66K |
Gemini 3.1 Flash-Litegemini-3.1-flash-liteinput 價為 text / image / video;audio input 另計 $0.50。cache read 同理:text/image/video $0.025、audio $0.05。cache storage $1.00 / 1M tokens / 小時。 | $0.25 | $1.5 | $0.025 | 1M | 66K |
Gemini 3.5 Flash-Litegemini-3.5-flash-litecache storage $1.00 / 1M tokens / 小時。Latest update: July 2026。 | $0.3 | $2.5 | $0.03 | 1M | 66K |
Gemini 2.5 Flashgemini-2.5-flashinput 為 text / image / video 價;audio input $1.00。cache read audio $0.10。cache storage $1.00 / 1M tokens / 小時。 | $0.3 | $2.5 | $0.03 | 1M | 66K |
Gemini 3.7 Flashgemini-3.7-flashintroductory 價,2026-12-31 到期,2027-01-01 起回 input $1.50 / output $7.50 / cache read $0.15(即 3.6 Flash 的水準)。context/max_output 取自 Models API 的 inputTokenLimit / outputTokenLimit,模型頁未載明。cache storage 未於定價頁單列。模型頁標 New Stable,無精確發布日。 | $0.75 | $3.75 | $0.075 | 1M | 66K |
Gemini 3.6 Flashgemini-3.6-flashGemini API(AI Studio)paid tier 價,非 Vertex AI。Google 無「cache write」單價,改收 storage $1.00 / 1M tokens / 小時。模型頁只給「Latest update: July 2026」無精確發布日。 | $1.5 | $7.5 | $0.15 | 1M | 66K |
Gemini 3.5 Flashgemini-3.5-flashoutput $9.00 高於較新的 3.6 Flash($7.50),已回定價頁確認非誤讀。cache storage $1.00 / 1M tokens / 小時。Latest update: May 2026,無精確發布日。 | $1.5 | $9 | $0.15 | 1M | 66K |
Gemini 3.1 Pro Previewgemini-3.1-pro-preview⚠️ preview 狀態(model id 帶 -preview)。階梯定價:prompt >200k tokens 時 input $4.00 / output $18.00 / cache read $0.40。此處填 ≤200k 基礎階。cache storage $4.50 / 1M tokens / 小時。目前 Gemini 線上唯一的 Pro 級新機種仍是 preview,正式版 3.x Pro 尚未見。 | $2 | $12 | $0.2 | 1M | 66K |
xAI
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
Grok Build 0.1grok-build-0.1列在 text models 表內、按 token 計價。名稱像 coding/agent 專用模型,是否算「通用文字對話模型」有討論空間。context 官方寫「256k」。階梯定價:≥200k 時 $2.00 / $4.00 / cached $0.40。 | $1 | $2 | $0.2 | 256K | — |
Grok 4.3grok-4.3階梯定價:≥200k tokens 時 $2.50 / $5.00 / cached $0.40。context 官方只寫「1M」。無 max output、無發布日。注意 4.3 比 4.5 便宜且 context 更大,兩者是不同定位不是新舊關係。 | $1.25 | $2.5 | $0.2 | 1M | — |
Grok 4.20 (reasoning)grok-4.20-0309-reasoning⚠️ 命名歧義:xAI 把同一個 4.20-0309 拆成 reasoning / non-reasoning / multi-agent 三個 model id,價格完全相同。若表要給讀者看,可能該合成一列。階梯定價:≥200k 時 $2.50 / $5.00 / cached $0.40。 | $1.25 | $2.5 | $0.2 | 1M | — |
Grok 4.20 (non-reasoning)grok-4.20-0309-non-reasoning同 grok-4.20-0309-reasoning,價格一致。階梯定價:≥200k 時 $2.50 / $5.00 / cached $0.40。 | $1.25 | $2.5 | $0.2 | 1M | — |
Grok 4.20 Multi-Agentgrok-4.20-multi-agent-0309multi-agent 變體,token 單價與 4.20 相同,但實際成本可能因內部多 agent 展開而放大,官方未說明。階梯定價:≥200k 時 $2.50 / $5.00 / cached $0.40。 | $1.25 | $2.5 | $0.2 | 1M | — |
Grok 4.5grok-4.5階梯定價:input ≥200k tokens 時 input $4.00 / output $12.00 / cached $0.60。此處填 <200k 基礎階。context 官方只寫「500k」,此處記 500,000(未給精確整數)。xAI 文件完全沒有 max output 與發布日。 | $2 | $6 | $0.3 | 500K | — |
DeepSeek
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
DeepSeek-V4-Flashdeepseek-v4-flashUSD per 1M tokens,此處填的是尖峰(list)價。官方頁寫「Off-peak rates are half of the peak rates」,離峰時段減半:尖峰為 UTC 01:00-04:00 與 06:00-10:00 的週一至週五,換成台灣時間就是 09:00-12:00 與 14:00-18:00,剛好整段落在上班時間,所以台灣白天使用者實際付的是這一欄。price_input 取 cache miss 價。context / max output 官方寫「1M」/「384K」未給精確整數,此處以十進位換算。 2026-08-25 複查:與 8/04 那次相比官方已調價,且當時記為「尚未生效」的尖離峰定價現已實施。 另有 deepseek-v4-flash-vision-exp 在同一張表上,尚未收進本站資料。 | $0.44 | $1.32 | $0.014 | 1M | 384K |
DeepSeek-V4-Prodeepseek-v4-proUSD per 1M tokens,此處填的是尖峰(list)價。官方頁寫「Off-peak rates are half of the peak rates」,離峰時段減半:尖峰為 UTC 01:00-04:00 與 06:00-10:00 的週一至週五,換成台灣時間就是 09:00-12:00 與 14:00-18:00,剛好整段落在上班時間,所以台灣白天使用者實際付的是這一欄。price_input 取 cache miss 價。context / max output 官方寫「1M」/「384K」未給精確整數,此處以十進位換算。 2026-08-25 複查:與 8/04 那次相比官方已調價,且當時記為「尚未生效」的尖離峰定價現已實施。 | $1.32 | $3.96 | $0.044 | 1M | 384K |
Alibaba
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
Qwen3.6-Flashqwen3.6-flash階梯定價:0-256K 為 $0.25 / $1.5(此處填基礎階);256K-1M 為 $1.0 / $4.0。此模型頁面未見折扣標註。Singapore/國際站價。model id 目前指向 qwen3.6-flash-2026-04-16。cache 單價未列。 | $0.25 | $1.5 | — | 1M | — |
Qwen3.7-Plusqwen3.7-plus階梯定價:0-256K tokens 為 $0.4 / $1.6(此處填的基礎階);256K-1M 為 $1.2 / $4.8。頁面另標「Limited-time 20% off」未寫到期日,實際扣款可能是 8 折。Singapore/國際站價。model id 目前指向 qwen3.7-plus-2026-05-26。cache 單價未列。 | $0.4 | $1.6 | — | 1M | — |
Qwen3.7-Maxqwen3.7-max⚠️ 填的是 List price。頁面同時標「Limited-time 50% off」但未寫到期日,實際扣款可能是 $1.25 / $3.75,必須人工確認。此為 Singapore/國際站價;中國大陸站以人民幣計價且約低 35-40%,HK/Frankfurt/US 另有夜間折扣(最高 8 折以上)。model id 目前指向 qwen3.7-max-2026-05-20。context 官方寫「1M」,未給 max input / max output 精確值。cache 價官方只寫「支援 context caching 折扣」未列單價。 | $2.5 | $7.5 | — | 1M | — |
Zhipu AI
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
GLM-4.7-FlashXglm-4.7-FlashXmodel id 大小寫依官方文件寫法 `glm-4.7-FlashX`(多數 API 實作不分大小寫,但保留原樣)。開放權重疑慮同 glm-4.7。 | $0.07 | $0.4 | $0.01 | 200K | 128K |
GLM-4.7glm-4.7⚠️ 智譜 GLM-4.x 線歷來會同步釋出開放權重,若嚴格套用「只收閉源」規則這筆可能該排除,交人工判斷。同系列另有 glm-4.7-Flash(完全免費,未收錄)。 | $0.6 | $2.2 | $0.11 | 200K | 128K |
GLM-4.6glm-4.6與 glm-4.7 同價。開放權重疑慮同上。定價頁另列 GLM-4.5 / 4.5-X / 4.5-Air / 4.5-AirX / GLM-4-32B-0414-128K,因屬開放權重或更舊世代未收錄。 | $0.6 | $2.2 | $0.11 | 200K | 128K |
GLM-5glm-5無發布日。 | $1 | $3.2 | $0.2 | 200K | 128K |
GLM-5-Turboglm-5-turbo⚠️ Turbo 比 GLM-5 本體貴($1.2 vs $1.0),不是常見的「Turbo = 便宜版」邏輯,已回頁面確認。模型頁描述為針對 OpenClaw 場景深度最佳化。 | $1.2 | $4 | $0.24 | 200K | 128K |
GLM-5.2glm-5.2Z.ai(智譜國際站)USD 牌價,per 1M tokens。中國站 open.bigmodel.cn 以人民幣計價、數字不同,未收錄。cache storage 官方標「Limited-time Free」。context 官方寫「1M tokens」、max output「128K tokens」,此處以十進位換算。無發布日。 | $1.4 | $4.4 | $0.26 | 1M | 128K |
GLM-5.1glm-5.1與 GLM-5.2 同價但 context 只有 200K。模型頁自稱「latest flagship」,與 5.2 的關係在官方文件上不一致,需人工判斷主從。無發布日。 | $1.4 | $4.4 | $0.26 | 200K | 128K |
Moonshot
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
Kimi K2.7 Codekimi-k2.7-codecoding 專用模型。price_input 為 cache miss 價。無 max output、無發布日。 | $0.95 | $4 | $0.19 | 262K | — |
Kimi K2.6kimi-k2.6cache hit $0.16 與 k2.7-code 的 $0.19 不同,兩頁分別讀取確認。kimi-k2.5 與 moonshot-v1 系列已對新使用者關閉、8/31 全平台下架,未收錄。 | $0.95 | $4 | $0.16 | 262K | — |
Kimi K2.7 Code Highspeedkimi-k2.7-code-highspeed同模型的高速版,價格為標準版 2 倍(約 180 tokens/s,短 context 可到 260)。這是速度分層不是 priority tier,屬標準同步呼叫。 | $1.9 | $8 | $0.38 | 262K | — |
Kimi K3kimi-k3USD per 1M tokens(官方國際站直接標美元)。price_input 為 cache miss 價。官方未列 cache storage 單價、未列 max output、未列發布日。注意 platform.moonshot.ai 已 301 導向 platform.kimi.ai。 | $3 | $15 | $0.3 | 1M | — |
MiniMax
| 模型 | 輸入 | 輸出 | 快取讀取 | Context | 輸出上限 |
|---|---|---|---|---|---|
MiniMax-M2.7MiniMax-M2.7與 M3 同價但 context 只有 204,800。無 max output、無發布日。 | $0.3 | $1.2 | $0.06 | 205K | — |
MiniMax-M3MiniMax-M3表列為牌價。官方掛「Permanent 50% off」,實付為 $0.30 / $1.20(cache read $0.06)。輸入超過 512k tokens 跳一階,牌價 $1.20 / $4.80。 | $0.6 | $2.4 | $0.12 | 1M | — |
MiniMax-M2.7-highspeedMiniMax-M2.7-highspeed高速版 input/output 為標準版 2 倍,但 cached input 仍是 $0.06(與標準版相同),這個不對稱看起來像官方頁面的錯字,建議抽查。M2.5 / M2.1 / M2 仍在 API 可用清單上,因屬更舊世代且為開放權重系列未收錄。 | $0.6 | $2.4 | $0.06 | 205K | — |
舊型號(7 個,官方仍在賣)
這些收在廠商的舊型號區,不再是主推,但仍然可以呼叫、仍然有牌價。 已經在用的人不用急著換,價格通常跟新版一樣或更低。
| 模型 | 輸入 | 輸出 | 快取讀取 | Context |
|---|---|---|---|---|
Gemini 2.5 Progemini-2.5-pro | $1.25 | $10 | $0.125 | 1M |
Claude Sonnet 4.6claude-sonnet-4-6 | $3 | $15 | $0.3 | 1M |
Claude Sonnet 4.5claude-sonnet-4-5 | $3 | $15 | $0.3 | — |
Claude Opus 4.8claude-opus-4-8 | $5 | $25 | $0.5 | 1M |
Claude Opus 4.7claude-opus-4-7 | $5 | $25 | $0.5 | 1M |
Claude Opus 4.6claude-opus-4-6 | $5 | $25 | $0.5 | 1M |
Claude Opus 4.5claude-opus-4-5 | $5 | $25 | $0.5 | — |
這些數字可以信到什麼程度
每一個價格都是從廠商自己的定價頁抄下來的,第三方彙整站只用來確認有哪些模型存在。 官方沒公開的欄位就留白,不會拿同系列其他型號的數字去補,也不會估一個看起來合理的。
每筆資料都記了查證日期,所以你看得出這張表有多新。廠商預告要調價的型號會在生效前換掉。 如果我們寫錯了,改完會在這裡標出更正紀錄,不會默默改掉。
用量大到牌價不合理?
上面是公開牌價。用量到一定規模,多數廠商都可以談,折扣幅度差很多。 如果你正在估一個專案的模型成本,把情境寫給我們,可以幫你算一次實際會落在哪裡。