BazaarLinkBazaarLink
登入
← 所有文章
發布時間 2026-09-28 · · 作者:BazaarLink · Claude · Sonnet 5.5 · Sonnet 5 · Anthropic · API 升級

Sonnet 5.5 官方說快 30%、省 30%?升級前 API 要改的事

整理 Anthropic 官方對 Claude Sonnet 5.5 的說法:快 30%、每任務成本最多降 30% 的條件,加上基準數字與升級到 Sonnet 5.5 前 API 必改的地方。

資料查詢日:2026 年 9 月 29 日。本文只用 Anthropic 的一手資料:Sonnet 5.5 發布文、Claude Platform 文件:Sonnet 5.5 概覽與What's new in Claude Sonnet 5.5。凡是「官方說」的數字,都是廠商自己的測試與客戶回報,不是我們的實測。

Anthropic 在 2026 年 9 月 28 日發布 Claude Sonnet 5.5;官方稱它是 Sonnet 5 的明確升級,輸出速度快 30% 以上,多數工作的每任務成本最多降低 30%。下面是官方發布短片(Claude 官方頻道):

YouTube video thumbnail

先看結論

  • 單價沒變,變的是「做完一件事用多少 tokens」。 官方定價與 Sonnet 5 相同(輸入每百萬 tokens $2、輸出 $10),「最多省 30%」來自同一件事用更少 tokens 與更少工具呼叫,不是單價變便宜。所以你的帳單會不會少 30%,要看你自己的工作。
  • 官方基準大幅領先 Sonnet 5。 例如 Terminal-Bench 4.0:Sonnet 5.5 為 70.6%,Sonnet 5 為 10.3%。但基準的推理強度設定不完全一致,下面會列出。
  • 升級不是只改 model ID。 官方文件列出 5 項會讓既有程式出錯的改動(其中包括:關閉推理的寫法、強制指定工具、temperature 等參數),上線前要先測。

官方對速度與成本的說法

官方發布文的主張有三層,不要混在一起看:

  1. 速度: 輸出速度比 Sonnet 5 快 30% 以上,並稱它是目前最快的 Sonnet。
  2. 每任務成本: 對多數工作最多降低 30%,原因是「通常用更少 tokens 完成相同的事」。
  3. 特定基準下的成本: 官方指出,在數項基準上,Sonnet 5.5 用 Low 或 Medium 推理強度,就能超過 Sonnet 5 的最佳分數,而每任務成本約為十分之一甚至更低(CursorBench 4.0 為 Low 強度、Terminal-Bench 為 Medium 強度時都是不到十分之一)。

第 3 點是「同一分數下比較成本」,不等於你平常的工作都能降到十分之一。第 2 點的「最多」也是上限,不是平均。

官方另外附上多家客戶的回報,數字如下(各家自己的測試環境,不能互相比較):

回報者官方轉述的數字
Balyasny Asset Management2,441 題財務任務中,每個答案約 12.1 萬 tokens,Sonnet 5 為 49.7 萬 tokens
Box結果快 2.4 倍,總 tokens 少 12%
Zendesk工單處理快 20%
AtlassianRovo Agents 最高快 30%
Slack離線 Slackbot 評測中,多數項目優於 Sonnet 5,且步驟更少
Lovable完成一項任務的 shell 執行次數約為 Sonnet 5 的一半

官方基準數字(Sonnet 5.5 對 Sonnet 5 與 Opus 5.5)

評測Sonnet 5.5Sonnet 5Opus 5.5
Terminal-Bench 4.0(代理式寫程式)70.6%10.3%66.4%
FrontierCode 1.1 Main(代理式寫程式)46.2%(Max)42.4%54.4%
CursorBench 4.0(代理式寫程式)55.5%34.1%57.8%
GDPval-AA v2.1(知識工作,Elo)184414491846
AA-Briefcase v1.1(知識工作,Elo)181113591822
Humanity's Last Exam(含工具)64.5%54.9%67.7%
OSWorld 2.1(電腦操作,partial)80.1%57.0%81.8%
Chartography(圖表辨識,無工具)61.6%15.6%64.4%

讀這張表要注意官方在頁尾註明的條件:Terminal-Bench 中 Opus 5.5 的成績是 Xhigh 強度;FrontierCode 中 Sonnet 5.5 是 Max 強度,且官方說 Max 強度在一項程式碼審查技能下出現逾時與多餘修改;GDPval-AA 與 AA-Briefcase 是在預發布版本上量的,有一個已修正的結構化輸出問題,官方預期分數略被低估。也就是說,這是廠商公布的成績,不同強度、不同工具設定不能直接互比;能怎麼複製到你的任務,還是要自己測。

費用怎麼算(單價相同)

單價:輸入 $2/輸出 $10/快取讀取 $0.2/快取寫入 $2.5(每百萬 tokens),與 Sonnet 5 相同,上下文 100 萬 tokens、最大輸出 12.8 萬 tokens(官方文件)。BazaarLink 模型目錄的 claude-sonnet-5.5 是同一組單價,台幣試算與兩版並排比較見 Claude Sonnet 5 要換 5.5 嗎。

官方說的「省錢」要靠你自己的帳單驗證:挑 20 至 30 個真實任務,同一份提示詞各跑 Sonnet 5 與 5.5,記錄輸入/輸出 tokens、重試次數與通過率,再看每個「完成的任務」花多少,而不是只比單價。

升級前 API 要改的事(官方文件)

以下是官方 What's new 文件列出的變動。它描述的是 Anthropic API 的行為;你透過 BazaarLink 呼叫時,請用自己的實際請求測過再上線。

  1. 關閉推理的寫法變了。 在 Sonnet 5.5 送 thinking: {"type": "disabled"} 會回 400;要關掉「事前思考」得改用 {"type": "between_tools"},而且只能搭配 high 或更低的推理強度(xhigh、max 會回 400)。
  2. 不支援強制指定工具。 tool_choice 設成 any 或指定某個工具會回 400;只支援 auto(預設)與 none。官方建議需要格式正確的工具輸入時,用 auto 加上 strict tool use,或改用結構化輸出。
  3. 思考區塊綁定模型與對話。 每個思考區塊記錄由哪個模型產生;Sonnet 5.5 讀得到 Sonnet 5 的思考區塊,但讀不到 Opus 5.5 的,其他模型也讀不到 Sonnet 5.5 的。中途換模型,換掉之後的回合就沒有原本的推理內容。另外,重播思考區塊前若改過 system prompt、工具或前面的訊息,在較新的帳號上會回 400,官方建議對話一律「只增不改」。
  4. 舊版電腦操作工具不被接受。 computer_20251124 會回 400,要改用 computer_toolset_20260801。
  5. advisor 工具的搭配變了。 用 Sonnet 5.5 當執行者時,Opus 4.8、Opus 4.7 與 Sonnet 5 不能當顧問,會回 400。

另有兩件不會報錯、但會改變行為的事:

  • 工具呼叫之間的文字改放在 thinking 區塊。 預設情況下(display: "omitted")這些文字是空的,如果你的介面會把工具呼叫之間的說明串流給使用者,畫面會在那段時間「安靜」,而且沒有任何錯誤訊息。
  • temperature、top_p、top_k 設成非預設值會回 400。

推理強度也被重新校準:同一個強度不會產生和 Sonnet 5 相同的思考量,官方建議重跑你的強度測試,不要直接沿用舊設定。一般從 high 開始;代理式寫程式與多步驟工具使用,明確的任務從 medium 開始,較難的再升到 high;聊天和對延遲敏感的用途從 medium 或 low 開始。

誰適合換?

建議先試 Sonnet 5.5: 日常寫程式、修 bug、整理文件與簡報這類範圍明確的工作(官方定位如此),而且你在意速度或 tokens 用量。

升級前先花時間測:

  • 程式裡有 thinking: disabled、強制 tool_choice、自訂 temperature 或舊版電腦操作工具。
  • 介面會顯示工具呼叫之間的文字。
  • 對話會在不同模型之間切換,或會編輯歷史訊息。

常見問題

Sonnet 5.5 比 Sonnet 5 便宜嗎?

單價相同。官方說的是「完成同一件事用更少 tokens」,所以每個任務的成本最多可降低 30%,實際要看你的任務。

官方說的「快 30%」是怎麼量的?

官方發布文只說輸出速度比 Sonnet 5 快 30% 以上;客戶回報的數字(例如 Zendesk 快 20%、Atlassian 最高快 30%)是各家自己的測試。實際延遲取決於提示長度、輸出長度與推理強度。

我可以繼續用 Sonnet 5 嗎?

可以。若要升級,請先對照官方遷移指南的檢查清單(上面 5 項是其中的破壞性改動),並重跑推理強度測試。

這篇文章裡的分數是我們測的嗎?

不是。所有基準與客戶數字都轉述自 Anthropic 官方發布文,並保留官方的條件註記。

資料來源

用 Token 計算 API 費用

輸入模型與 Token 用量,快速估算一個請求的 API 成本。

開啟費用試算
立即體驗 BazaarLink

台幣計費・統一發票・主流 AI 模型・OpenAI 相容 API

免費註冊 / 登入企業採購洽詢
相關文章
Claude · Sonnet 5.5 · Sonnet 5 · 模型比較 · 定價
Claude Sonnet 5 要換 5.5 嗎?同價 $2/$10 規格與台幣試算
API · Jev · evaluations
Jev:依據狀態取得結構化評估結果
GPT-6 Sol · GPT-6 · API 價格 · 模型呼叫 · 長上下文 · 教學
GPT-6 Sol API 價格與呼叫範例:輸入 $2、輸出 $10
客服
客服
您好!有什麼可以協助?
請留下訊息,我們會盡快回覆。