Claude Opus 5.5 vs Opus 5:牌價降兩成,實測帳單降三成
Claude Opus 5.5 牌價比 Opus 5 便宜 20%,快取讀取便宜 60%。本站用同一套 Claude Code 任務各跑 18 次、只換 model ID,Opus 5.5 的帳單少 32.9%,比只換牌價多省 9.5 個百分點,多的主要來自思考 token 少了一半。代價是它更照字面:摘要字數 9 次全達標,修 bug 時有 3 次沒順手處理題目沒要求的邊界。
目錄(11 節)
Claude Opus 5.5 的牌價比 Opus 5 便宜兩成:輸入 $4、輸出 $20。定價表上有一格降得更多,快取讀取從 $0.50 降到 $0.20。
本站拿 8 月做 CLAUDE.md 實驗的同一套 Claude Code 任務,兩顆各跑 18 次,只換 model ID。Opus 5.5 的帳單少了 32.9%,比只換牌價算出來的 23.4% 再多省 9.5 個百分點。
多省的那一段主要來自思考 token 少了一半。另一個變化不在帳單上:它更照字面做事。
先給選擇規則
| 情況 | 建議 |
|---|---|
| 程式沒關思考、沒用強制工具 | 直接換,牌價省 20%,本站實測省 32.9% |
程式裡有 thinking: disabled |
先改成用 effort 控制,否則回 400 |
程式用 tool_choice 的 any 或 tool |
先改成 auto 加 strict tool use,否則回 400 |
| 流程依賴模型「順手多做一點」 | 換過去之前,把邊界條件寫進 prompt |
| 長 session 的 agent,快取讀取佔帳單大宗 | 省最多的一種,公式上限 60% |
本表是下面各節結論的摘要,不含新資料,每一條的依據見對應章節。
定價表疊起來
Anthropic 定價頁上兩顆並排如下,2026-09-23 實查。
| 項目 | Claude Opus 5 | Claude Opus 5.5 | 降幅 |
|---|---|---|---|
| 輸入(每 1M token) | $5 | $4 | 20% |
| 輸出 | $25 | $20 | 20% |
| 快取寫入(5 分鐘) | $6.25 | $5 | 20% |
| 快取寫入(1 小時) | $10 | $8 | 20% |
| 快取讀取 | $0.50 | $0.20 | 60% |
| Batch 輸入 / 輸出 | $2.50 / $12.50 | $2 / $10 | 20% |
| Fast mode 輸入 / 輸出 | $10 / $50 | $8 / $40 | 20% |
| Context window / 最大輸出 | 1M / 128K | 1M / 128K | 不變 |
表上只有一格不是 20%。Opus 5 的快取讀取是輸入價的 0.1 倍,Opus 5.5 改成 0.05 倍,輸入價本身又降了兩成,兩者疊起來,這一格降了 60%。
這一格決定了你實際省多少。其他項目都是 20%,只有快取讀取是 60%,所以:
省下的比例 = 20% + 40% × 快取讀取佔 Opus 5 帳單的比例
快取讀取佔一成,省 24%;佔一半,省 40%。上限是 60%,那是帳單全部都是快取讀取的極端情況。
Tokenizer 沒換,這個降價在繁中帳單上照單全收
降價要落到繁中帳單上,前提是同一份文件切出來的 token 數沒變。本站用五種語料、共 14,951 個繁中字,打 Anthropic 的 token counting 端點量了兩顆,五種語料的 token 數逐格相同,每個繁中字都是 1.7198 個 token(Opus 5 量測於 2026-09-05,Opus 5.5 於 2026-09-23,原始資料 bench/tokenizer/results.json)。
所以上面那條公式可以直接套到繁中負載上,不用再乘任何係數。跟其他廠牌比的話,Claude 5 世代這個係數偏高,細節在繁中 token 成本。
實測:同一套 Claude Code 任務,各跑 18 次
公式只算得到牌價那一半。另一半是 token 用量會不會變:Opus 5.5 的預設 effort 從 high 降到 medium,思考又關不掉,這兩件事往相反方向推。只能跑一次看。
方法沿用 8 月那篇:兩個小任務(修一個函式、寫 200 字摘要)× 三種 CLAUDE.md × 每組 3 次,每次都是全新的工作目錄與工作階段。這次只換 model ID,effort 用預設值,其他什麼都不改。
| 項目 | Claude Opus 5 | Claude Opus 5.5 | 差 |
|---|---|---|---|
| 18 次總花費 | $2.087 | $1.400 | −32.9% |
| 只換牌價、token 用量照 Opus 5 | $1.598 | −23.4% | |
| 輸出 token(含思考) | 53,886 | 46,356 | −14.0% |
| 其中思考 token | 19,052 | 9,386 | −50.7% |
2026-09-24 量測,Claude Code 2.1.280。花費依各次回傳的 token 用量乘上 Anthropic 牌價重算,不採用任何帳單頁的數字。
這組任務裡,Opus 5 的帳單有 65% 是輸出,快取讀取只佔 8.5%。套前面的公式是 20% + 40% × 8.5% = 23.4%,跟「只換牌價」那一列一致。多出來的 9.5 個百分點,是 Opus 5.5 少寫的那些 token。
拆成兩個任務,方向就不一樣了:
| 任務 | Opus 5 每次 | Opus 5.5 每次 | 實測 | 只換牌價 | 平均輪數 |
|---|---|---|---|---|---|
| 修一個函式 | $0.0685 | $0.0311 | −54.6% | −24.7% | 5.6 → 4.1 |
| 寫 200 字摘要 | $0.1634 | $0.1245 | −23.8% | −22.8% | 6.0 → 9.1 |
每個任務各 9 次(三種 CLAUDE.md 各 3 次)的平均。
修函式那一題,Opus 5.5 少跑一輪半、輸出少了四成,實測省下的是牌價的兩倍多。
寫摘要那一題,它的思考 token 少了一半多,但輪數多了五成,快取讀取量接近翻倍(23,161 → 43,779)。多跑的那幾輪被便宜的快取讀取吸收掉,最後剛好跟只換牌價打平。
再細分到三種 CLAUDE.md,六格的結果從省 66.7% 到貴 13.6% 都有。每格只有 3 次,單格不要拿來下結論,但它說明了一件事:省多少跟任務形狀有關,牌價只是下限的參考。
它更照字面做事
同一批試驗也評了結果對不對,評法跟 8 月那篇相同:
| 檢查項目 | Claude Opus 5 | Claude Opus 5.5 |
|---|---|---|
| 修函式:題目要求的修正 | 9/9 | 9/9 |
修函式:name 是 None 也不當掉 |
9/9 | 6/9 |
| 修函式:沒動到旁邊三個函式 | 9/9 | 9/9 |
| 摘要:三個重點都涵蓋 | 9/9 | 9/9 |
| 摘要:字數落在 150 到 250 | 0/9 | 9/9 |
題目只說「缺少 name 時視為空字串,其他地方不要動」。Opus 5 每次都順手把 None 也處理掉;Opus 5.5 有 3 次只修了題目講的那一件,None 進來照樣會當掉。反過來,200 字的摘要,Opus 5 九次落在 291 到 394 字,Opus 5.5 九次落在 220 到 238 字。
兩件事是同一個性格:講什麼做什麼。要它處理的邊界條件,換過去之後得寫出來。
思考關不掉,小請求反而變貴
上面那批任務的思考 token 少了一半,但方向在極短的請求上會反過來。本站送了一句「回一個字:好」各一次:Opus 5 輸出 3 個 token,思考 0;Opus 5.5 輸出 30 個,其中 27 個是思考。
只有一次,不當成比例看。它說明的是機制:Opus 5 可以把思考整個關掉,Opus 5.5 不行,effort 只能調少不能調到零。大量分類、抽欄位這類一問一答的負載,換過去之前值得用自己的請求量一次。
換過去之前要改的程式
遷移指南列了四個破壞性變更:
| 變更 | 在 Opus 5.5 上會怎樣 | 改法 |
|---|---|---|
| 思考關不掉 | thinking: disabled 與手動 budget_tokens 都回 400 |
拿掉 thinking,改用 effort 控制 |
| 不支援強制工具 | tool_choice 的 any 與 tool 回 400 |
改 auto,搭配 strict tool use 或結構化輸出 |
| 思考區塊綁模型 | 路由到其他模型時,Opus 5.5 的思考區塊只有 Fable 5.1 與 Mythos 5.1 讀得懂 | 對話保持只增不改 |
| 舊版 computer use 工具 | Claude API 與 Google Cloud 上 computer_20251124 回 400 |
改用 computer_toolset_20260801 |
另外兩件不會報錯、但會改變帳單的事:
- 預設 effort 從
high變成medium。 沒指定 effort 的請求,換過去之後思考量會不一樣。 - 工具呼叫之間的說明文字改放進思考區塊。 預設不顯示,把這段文字當進度提示給使用者看的介面,換過去會變安靜。
該從 Opus 5 換到 Opus 5.5 嗎?
多數情況直接換。 牌價省 20% 是保底,快取讀取越重省越多;本站這組小任務實測省 32.9%,六格裡只有一格變貴。
先改程式再換。 關思考與強制工具這兩條會直接回 400,不是慢慢變差,換之前 grep 一次就知道有沒有。
依賴模型補邊界的流程,先補 prompt。 它不再順手多做,這在修 bug 時是風險,在控制字數時是好處。
今天就能做的一件事
在程式碼裡搜三個字串:"disabled"(通常出現在 thinking 設定裡)、budget_tokens 與 tool_choice。有出現的地方,就是換過去第一個會壞的地方。
沒出現的話,換 model ID,把 effort 明確寫成你要的檔位,再用自己的 usage 記錄比一週。前面那條公式告訴你保底省多少,實際數字只有你的負載量得出來。
本站沒有的數字
沒有能力比較。 本站 2026-08-21 的對戰資料快照裡沒有 Opus 5.5,上面的品質檢查只有兩個小任務,不代表整體能力。
樣本很小。 兩個任務、每格 3 次。總帳單的方向在兩個任務上一致,但幅度看任務形狀,你的負載不一定落在這個區間。
量測路徑跟 8 月不同。 這次兩顆都經 MixRoute 的 Anthropic 原生端點轉發(本站跟 MixRoute 的關係寫在關於頁),用 API key 模式,快取寫入是 5 分鐘那一檔,並關閉了 Claude Code 的實驗性 beta 功能。兩顆條件相同,彼此可以比;但絕對金額不能拿去跟 8 月那篇對照,那次是訂閱登入、快取寫入是 1 小時那一檔。
原始資料與重算腳本在 bench/opus55/。