文章
模型比較、成本分析與實測紀錄,全部自己跑過。
Claude Opus 5.5 vs Opus 5:牌價降兩成,實測帳單降三成
Claude Opus 5.5 牌價比 Opus 5 便宜 20%,快取讀取便宜 60%。本站用同一套 Claude Code 任務各跑 18 次、只換 model ID,Opus 5.5 的帳單少 32.9%,比只換牌價多省 9.5 個百分點,多的主要來自思考 token 少了一半。代價是它更照字面:摘要字數 9 次全達標,修 bug 時有 3 次沒順手處理題目沒要求的邊界。
Gemini 3.1 Pro Preview vs GPT-6 Sol:輸入省一成,長文先變貴
兩顆輸入都是 $2、快取讀取都是 $0.20,輸出 Gemini 3.1 Pro Preview 貴兩成。換算成繁體中文之後,輸入反而是 Gemini 便宜 10.7%,輸出只貴 7.2%;但它的長 context 門檻比 GPT-6 Sol 早 3.7 萬字到,夾在兩道門檻中間的那一段,GPT-6 Sol 的輸入便宜 44%。
GPT-6 Astra vs Claude Fable 5.1:牌價一樣,繁中帳單差 24%
兩家最旗艦的標準價逐格相同:輸入 $10、輸出 $50、快取寫入 $12.50、Batch $5 與 $25,連最大輸出都是 128K。定價表上只有快取讀取那一格不一樣,而真正決定帳單的三件事有兩件不在表上,方向還不一致:繁中偏 Astra、超過 20.9 萬字偏 Fable 5.1、快取則看回合間隔有沒有超過 13 分鐘。
Claude Fable 5 vs Fable 5.1:快取讀取只要四分之一價
同一格價位、同一個 tokenizer、同樣 1M context,官方定價表上這兩顆只差一欄:快取讀取從 $1.00 掉到 $0.25。這一欄把「該不該買 1 小時 TTL」整個翻掉,回本點從 7.5 次讀取變成 30 次。代價是三個會讓現有程式直接回 400 的破壞性變更。
Claude Sonnet 5 vs GPT-5.6 Terra:繁中貴三成,長文反而便宜
兩顆同價位帶的中階模型,近 4.8 萬筆公開對戰紀錄在 29 個維度上分不出勝負,多重比較校正後兩邊都是 0。分得出來的是帳單:同一份繁體中文,Claude Sonnet 5 的輸入貴 32%;但輸入一超過 272,000 token,GPT-5.6 Terra 整包改以兩倍計價,便宜的那個當場換人。
DeepSeek V4 Pro vs GPT-5.6 Luna:贏了品質,輸了帳單
拿 5 萬筆對戰紀錄跑統計檢定,DeepSeek V4 Pro 在 29 個維度贏 10 個、輸 1 個、18 個分不出來。但換一個變體,站得住的只剩兩個。而它現在的價格是對手的 1.8 到 5.4 倍,尖峰時段剛好蓋住台灣的上班時間。
從台灣打 AI API 慢在哪?連線只佔首字延遲的一成
從台北量三家 API 的八個模型,DNS 加 TCP 加 TLS 三家都落在 104 到 109 毫秒,只佔首字延遲的 7% 到 15%。慢的地方不是距離。這篇拆開首字延遲、吐字速度與尾巴延遲,並記下量測時翻掉的兩個假設。
Claude 開始在文字裡加浮水印,你該擔心嗎
Claude 從 8 月起在輸出的文字裡加浮水印,複製貼上也帶得走。但它證明的是「這段文字經過 AI」,不是「這個人偷懶」,而且改寫過後偵測率會從 99.8% 掉到 49.8%。這篇講原理、各家現況、法規怎麼要求,以及你實際上該做什麼。
繁體中文比簡體貴多少?八個 tokenizer 實測 3.7% 到 21%
把同一份繁體文件轉成簡體再送給模型,token 數會少 3.7% 到 21%,八個 tokenizer 全部往下走。但幅度差 5.8 倍,而且省最多的那家因此換了名次。這篇量的是省多少、什麼情況值得省,以及轉回繁體會掉幾個字。
中文一個字要幾個 token?23 個模型的實測與成本對照
網路上到處寫著「中文一個字約 1.5 到 2 個 token」。實測 23 個現役模型,純中文的比例落在 0.72 到 1.17 之間,沒有一家超過 1.2。而牌價相同的模型之間,帳單最多差 48%。
AI coding agent 的快取成本:不是切模型,是你離開座位
4,300 個真實 session 的實測顯示,coding agent 的快取命中率高達 95.8%,但掉下來的那幾個百分點幾乎全部集中在人類發呆的空檔。這篇算清楚錢怎麼分桶、漏在哪,以及同一次失效在五個工具上是五種不同的東西。
你打一句話,AI 讀的是 10 萬個 token:提示詞快取的原理
模型沒有記憶,所以每一輪都要把整份對話重送一次。快取讓那份重複內容只收一折,代價是它只認「從第一個字開始一模一樣」的那一段。這篇不談設定,只把觀念講到你能自己判斷任何一個動作會不會打斷它。
Claude Code 一個月花多少錢:訂閱和 API 該怎麼選
Anthropic 自己公布的企業實測是每人每月 150 到 250 美元,而 Max 20x 訂閱只要 200。這篇用官方數字把兩邊算清楚,給一條你可以自己套的回本公式,並拆開多數人沒注意到的快取成本差。
Opus 5 的 CLAUDE.md 該怎麼寫:為什麼三句話讓同個任務貴一倍
Opus 5 出來後,舊的 CLAUDE.md 反而拖累它。官方建議改成減法,這篇講清楚該怎麼寫、為什麼一句舊的 double-check 指令會讓任務成本翻倍,並用 18 次對照實驗驗證。
拿學測數學 B 實測 9 個模型,最貴的不一定最準
同樣 16 題、同樣純文字輸入,最省的模型跟旗艦一樣滿分,成本只要 1/35。而標榜便宜的那個,帳單比旗艦還貴。