Sonnet 5.5 官方說快 30%、省 30%?升級前 API 要改的事
整理 Anthropic 官方對 Claude Sonnet 5.5 的說法:快 30%、每任務成本最多降 30% 的條件,加上基準數字與升級到 Sonnet 5.5 前 API 必改的地方。
資料查詢日:2026 年 9 月 29 日。本文只用 Anthropic 的一手資料:Sonnet 5.5 發布文、Claude Platform 文件:Sonnet 5.5 概覽與What's new in Claude Sonnet 5.5。凡是「官方說」的數字,都是廠商自己的測試與客戶回報,不是我們的實測。
Anthropic 在 2026 年 9 月 28 日發布 Claude Sonnet 5.5;官方稱它是 Sonnet 5 的明確升級,輸出速度快 30% 以上,多數工作的每任務成本最多降低 30%。下面是官方發布短片(Claude 官方頻道):
先看結論
- 單價沒變,變的是「做完一件事用多少 tokens」。 官方定價與 Sonnet 5 相同(輸入每百萬 tokens $2、輸出 $10),「最多省 30%」來自同一件事用更少 tokens 與更少工具呼叫,不是單價變便宜。所以你的帳單會不會少 30%,要看你自己的工作。
- 官方基準大幅領先 Sonnet 5。 例如 Terminal-Bench 4.0:Sonnet 5.5 為 70.6%,Sonnet 5 為 10.3%。但基準的推理強度設定不完全一致,下面會列出。
- 升級不是只改 model ID。 官方文件列出 5 項會讓既有程式出錯的改動(其中包括:關閉推理的寫法、強制指定工具、
temperature等參數),上線前要先測。
官方對速度與成本的說法
官方發布文的主張有三層,不要混在一起看:
- 速度: 輸出速度比 Sonnet 5 快 30% 以上,並稱它是目前最快的 Sonnet。
- 每任務成本: 對多數工作最多降低 30%,原因是「通常用更少 tokens 完成相同的事」。
- 特定基準下的成本: 官方指出,在數項基準上,Sonnet 5.5 用 Low 或 Medium 推理強度,就能超過 Sonnet 5 的最佳分數,而每任務成本約為十分之一甚至更低(CursorBench 4.0 為 Low 強度、Terminal-Bench 為 Medium 強度時都是不到十分之一)。
第 3 點是「同一分數下比較成本」,不等於你平常的工作都能降到十分之一。第 2 點的「最多」也是上限,不是平均。
官方另外附上多家客戶的回報,數字如下(各家自己的測試環境,不能互相比較):
| 回報者 | 官方轉述的數字 |
|---|---|
| Balyasny Asset Management | 2,441 題財務任務中,每個答案約 12.1 萬 tokens,Sonnet 5 為 49.7 萬 tokens |
| Box | 結果快 2.4 倍,總 tokens 少 12% |
| Zendesk | 工單處理快 20% |
| Atlassian | Rovo Agents 最高快 30% |
| Slack | 離線 Slackbot 評測中,多數項目優於 Sonnet 5,且步驟更少 |
| Lovable | 完成一項任務的 shell 執行次數約為 Sonnet 5 的一半 |
官方基準數字(Sonnet 5.5 對 Sonnet 5 與 Opus 5.5)
| 評測 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0(代理式寫程式) | 70.6% | 10.3% | 66.4% |
| FrontierCode 1.1 Main(代理式寫程式) | 46.2%(Max) | 42.4% | 54.4% |
| CursorBench 4.0(代理式寫程式) | 55.5% | 34.1% | 57.8% |
| GDPval-AA v2.1(知識工作,Elo) | 1844 | 1449 | 1846 |
| AA-Briefcase v1.1(知識工作,Elo) | 1811 | 1359 | 1822 |
| Humanity's Last Exam(含工具) | 64.5% | 54.9% | 67.7% |
| OSWorld 2.1(電腦操作,partial) | 80.1% | 57.0% | 81.8% |
| Chartography(圖表辨識,無工具) | 61.6% | 15.6% | 64.4% |
讀這張表要注意官方在頁尾註明的條件:Terminal-Bench 中 Opus 5.5 的成績是 Xhigh 強度;FrontierCode 中 Sonnet 5.5 是 Max 強度,且官方說 Max 強度在一項程式碼審查技能下出現逾時與多餘修改;GDPval-AA 與 AA-Briefcase 是在預發布版本上量的,有一個已修正的結構化輸出問題,官方預期分數略被低估。也就是說,這是廠商公布的成績,不同強度、不同工具設定不能直接互比;能怎麼複製到你的任務,還是要自己測。
費用怎麼算(單價相同)
單價:輸入 $2/輸出 $10/快取讀取 $0.2/快取寫入 $2.5(每百萬 tokens),與 Sonnet 5 相同,上下文 100 萬 tokens、最大輸出 12.8 萬 tokens(官方文件)。BazaarLink 模型目錄的 claude-sonnet-5.5 是同一組單價,台幣試算與兩版並排比較見 Claude Sonnet 5 要換 5.5 嗎。
官方說的「省錢」要靠你自己的帳單驗證:挑 20 至 30 個真實任務,同一份提示詞各跑 Sonnet 5 與 5.5,記錄輸入/輸出 tokens、重試次數與通過率,再看每個「完成的任務」花多少,而不是只比單價。
升級前 API 要改的事(官方文件)
以下是官方 What's new 文件列出的變動。它描述的是 Anthropic API 的行為;你透過 BazaarLink 呼叫時,請用自己的實際請求測過再上線。
- 關閉推理的寫法變了。 在 Sonnet 5.5 送
thinking: {"type": "disabled"}會回 400;要關掉「事前思考」得改用{"type": "between_tools"},而且只能搭配 high 或更低的推理強度(xhigh、max 會回 400)。 - 不支援強制指定工具。
tool_choice設成any或指定某個工具會回 400;只支援auto(預設)與none。官方建議需要格式正確的工具輸入時,用auto加上 strict tool use,或改用結構化輸出。 - 思考區塊綁定模型與對話。 每個思考區塊記錄由哪個模型產生;Sonnet 5.5 讀得到 Sonnet 5 的思考區塊,但讀不到 Opus 5.5 的,其他模型也讀不到 Sonnet 5.5 的。中途換模型,換掉之後的回合就沒有原本的推理內容。另外,重播思考區塊前若改過 system prompt、工具或前面的訊息,在較新的帳號上會回 400,官方建議對話一律「只增不改」。
- 舊版電腦操作工具不被接受。
computer_20251124會回 400,要改用computer_toolset_20260801。 - advisor 工具的搭配變了。 用 Sonnet 5.5 當執行者時,Opus 4.8、Opus 4.7 與 Sonnet 5 不能當顧問,會回 400。
另有兩件不會報錯、但會改變行為的事:
- 工具呼叫之間的文字改放在
thinking區塊。 預設情況下(display: "omitted")這些文字是空的,如果你的介面會把工具呼叫之間的說明串流給使用者,畫面會在那段時間「安靜」,而且沒有任何錯誤訊息。 temperature、top_p、top_k設成非預設值會回 400。
推理強度也被重新校準:同一個強度不會產生和 Sonnet 5 相同的思考量,官方建議重跑你的強度測試,不要直接沿用舊設定。一般從 high 開始;代理式寫程式與多步驟工具使用,明確的任務從 medium 開始,較難的再升到 high;聊天和對延遲敏感的用途從 medium 或 low 開始。
誰適合換?
建議先試 Sonnet 5.5: 日常寫程式、修 bug、整理文件與簡報這類範圍明確的工作(官方定位如此),而且你在意速度或 tokens 用量。
升級前先花時間測:
- 程式裡有
thinking: disabled、強制tool_choice、自訂temperature或舊版電腦操作工具。 - 介面會顯示工具呼叫之間的文字。
- 對話會在不同模型之間切換,或會編輯歷史訊息。
常見問題
Sonnet 5.5 比 Sonnet 5 便宜嗎?
單價相同。官方說的是「完成同一件事用更少 tokens」,所以每個任務的成本最多可降低 30%,實際要看你的任務。
官方說的「快 30%」是怎麼量的?
官方發布文只說輸出速度比 Sonnet 5 快 30% 以上;客戶回報的數字(例如 Zendesk 快 20%、Atlassian 最高快 30%)是各家自己的測試。實際延遲取決於提示長度、輸出長度與推理強度。
我可以繼續用 Sonnet 5 嗎?
可以。若要升級,請先對照官方遷移指南的檢查清單(上面 5 項是其中的破壞性改動),並重跑推理強度測試。
這篇文章裡的分數是我們測的嗎?
不是。所有基準與客戶數字都轉述自 Anthropic 官方發布文,並保留官方的條件註記。
資料來源
- Anthropic:Introducing Claude Sonnet 5.5
- Claude Platform 文件:Claude Sonnet 5.5、What's new in Claude Sonnet 5.5
- 官方影片:Introducing Claude Sonnet 5.5(Claude 官方 YouTube 頻道)
輸入模型與 Token 用量,快速估算一個請求的 API 成本。
開啟費用試算