Haiku 5.5 vs DeepSeek、GLM、MiMo Flash 價格與 AA 指數
Claude Haiku 5.5 輸入每百萬 tokens 只要 US$0.10,但提示超過 100K 單價變 5 倍,每題輸出量也最多。對照 DeepSeek V4.1 Flash、GLM-5.3-Flash、MiMo-V2.6-Flash 的官方定價與 AA 智慧指數(截至 10/08)。
資料查詢日:2026 年 10 月 8 日(以下簡稱「截至 10/08」)。價格取自各家官方定價頁,智慧指數與各項測評分數取自 Artificial Analysis(下稱 AA)的模型頁與模型對比頁,BazaarLink 價格取自公開模型目錄(/api/v1/models)。各家之後都可能改價或更新分數,採用前請回到來源頁確認。
Claude Haiku 5.5 在 10 月 7 日推出,輸入每百萬 tokens 只要 US$0.10。便宜的小模型不只這一個:DeepSeek V4.1 Flash、GLM-5.3-Flash、MiMo-V2.6-Flash 也都在同一個價位帶。這篇把四個模型的「價格」與「AA 實測能力」放在同一張表,並說清楚單價不等於總花費。
先講結論
- 輸入單價 Haiku 5.5 最低,但只限 100K tokens 以內的提示。 提示超過 100K tokens 後,輸入與輸出單價都變成 5 倍(US$0.50/US$2.50)。
- AA 智慧指數:Haiku 5.5 43 分,四個裡最高,但只領先 GLM-5.3-Flash(42)1 分。 這是 Haiku 5.5 在最高推理強度(Max)下的分數;調到 Medium 只有 34 分,低於其他三個。
- 單價低不代表一題花得少。 Haiku 5.5(Max)每題平均輸出約 162k tokens,是這四個裡最多的;AA 實測每題平均花費 US$0.21,MiMo-V2.6-Flash 只要 US$0.06。
- 終端機/編碼代理(Terminal-Bench 4.0)Haiku 5.5 與 GLM-5.3-Flash 並列最高(33%);SaaS 工作流程(AutomationBench-AA)Haiku 5.5 最低(35%),但 AA 說這個分數可能偏低(原因見下)。
價格對照(官方標價)
單位:美元,每百萬 tokens。截至 10/08。「輸入/輸出/快取命中」三欄為各家官方標價,最右兩欄為 BazaarLink 價格。
| 模型 | 官方輸入 | 官方輸出 | 官方快取命中 | BazaarLink 輸入 | BazaarLink 輸出 |
|---|---|---|---|---|---|
| Claude Haiku 5.5(提示 ≤100K) | 0.10 | 0.50 | 0.01 | 0.10 | 0.50 |
| Claude Haiku 5.5(提示 >100K) | 0.50 | 2.50 | 0.05 | 0.50 | 2.50 |
| DeepSeek V4.1 Flash(高峰) | 0.30 | 1.20 | 0.006 | 0.30 | 1.20 |
| DeepSeek V4.1 Flash(離峰) | 0.15 | 0.60 | 0.003 | — | — |
| GLM-5.3-Flash | 0.15 | 0.50 | 0.03 | 0.15 | 0.50 |
| MiMo-V2.6-Flash | 0.14 | 0.28 | 0.0028 | 0.14 | 0.28 |
「—」代表 BazaarLink 沒有這個價格。
幾個要注意的地方:
- Haiku 5.5 是依提示長度分兩級計價。 Anthropic 定價頁寫明「提示超過 100,000 tokens」適用較高的一組價格;BazaarLink 目錄同樣標示 100,000 tokens 以上的分級價。長文件、長對話或大量工具輸出很容易跨過這條線,估算費用時要用你實際的提示長度。
- DeepSeek V4.1 Flash 有高峰與離峰價。 官方定價頁寫明離峰價是高峰價的一半;高峰時段為週一至週五(不含中國法定假日)的 UTC 01:00–04:00 與 06:00–10:00(台灣時間 09:00–12:00、14:00–18:00)。BazaarLink 目錄上的 DeepSeek V4.1 Flash 是單一價格,數字與官方的高峰價相同。
- GLM-5.3-Flash 的快取儲存,Z.ai 定價頁標示為「限時免費」,之後可能收費。
- MiMo-V2.6-Flash 小米官方模型頁同時列人民幣與美元價格:輸入 ¥1、輸出 ¥2、快取命中 ¥0.02(每百萬 tokens),美元價即上表數字。
- 上下文長度:BazaarLink 目錄中四個模型都約 100 萬 tokens(MiMo-V2.6-Flash 為 1,048,576)。
Haiku 5.5 另有 5 分鐘快取寫入 US$0.125、1 小時快取寫入 US$0.20(提示 ≤100K,每百萬 tokens),其他三家官方頁沒有同樣的寫入分項,所以本表不列寫入價。
AA 智慧指數與分項測評
AA 智慧指數(v4.3.2)綜合 10 項評測。Haiku 5.5 與 DeepSeek V4.1 Flash 在 AA 頁面上標示為 Max 推理強度;GLM-5.3-Flash 與 MiMo-V2.6-Flash 在 AA 頁面上沒有標示推理強度。截至 10/08:
| 模型 | AA 智慧指數 | 長條(每格 ≈ 2 分) |
|---|---|---|
| 參考:Claude Sonnet 5.5 | 56 | ████████████████████████████ |
| Claude Haiku 5.5(Max) | 43 | █████████████████████▌ |
| GLM-5.3-Flash | 42 | █████████████████████ |
| DeepSeek V4.1 Flash(Max) | 39 | ███████████████████▌ |
| MiMo-V2.6-Flash | 38 | ███████████████████ |
| 參考:Claude Haiku 4.5(上一代) | 17 | ████████▌ |
Haiku 5.5 比上一代 Haiku 4.5 高 26 分。Haiku 5.5 與 GLM-5.3-Flash 只差 1 分,不宜解讀成明顯的勝負。
分項測評(AA 實測;每題輸出 tokens 越少越省,每題花費為 AA 跑智慧指數的平均):
| 項目 | Haiku 5.5(Max) | GLM-5.3-Flash | DeepSeek V4.1 Flash(Max) | MiMo-V2.6-Flash |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 33% | 33% | 27% | 23% |
| AA-Omniscience 指數 | 11 | 7 | −5 | −13 |
| AutomationBench-AA | 35%* | 60% | 69% | 64% |
| 每題平均輸出 tokens | 162k | 69k | 89k | 78k |
| 每題平均花費 | US$0.21 | US$0.25 | US$0.27 | US$0.06 |
- Terminal-Bench 4.0(終端機/編碼代理,越高越好): AA 的說明是 66 題、涵蓋軟體、機器學習、科學等領域的複雜終端機工作。
- AA-Omniscience(越高越可靠): 指數範圍 −100 到 100;AA 的說明是「獎勵答對、懲罰幻覺,拒答不扣分」,0 代表答對與答錯一樣多,負分代表答錯多於答對。
- AutomationBench-AA(SaaS 工作流程,越高越好): 衡量代理在模擬 SaaS 應用環境中完成任務的比例,違反護欄的任務不計分。
* AA 的註記: Haiku 5.5 的 AutomationBench-AA 35% 很可能偏低。AA 表示在發布前測試時,安全拒答的問題讓模型過度拒答;Anthropic 正在修正,AA 計畫在修正上線後重跑,預期分數會上升(以上依 AA 在 X 上的說明,經媒體 OfficeChai 轉述)。重跑之前,這一格不適合拿來和其他三家比。
單價不等於總價:每題花費
AA 用同一套智慧指數題目,統計各模型平均每題的輸出量與花費:
| 模型 | 輸出單價(每百萬) | 每題輸出 tokens | 每題平均花費 |
|---|---|---|---|
| Claude Haiku 5.5(Max) | US$0.50 | 162k | US$0.21 |
| DeepSeek V4.1 Flash(Max) | US$1.20(高峰) | 89k | US$0.27 |
| GLM-5.3-Flash | US$0.50 | 69k | US$0.25 |
| MiMo-V2.6-Flash | US$0.28 | 78k | US$0.06 |
Haiku 5.5 的輸出單價與 GLM-5.3-Flash 相同,但在 Max 強度下每題多輸出約 2.3 倍的 tokens,吃掉一部分單價優勢。MiMo-V2.6-Flash 單價與輸出量都低,每題花費最低。你的實際花費會因高峰與離峰、快取命中率、提示長度而不同。
Haiku 5.5 的推理強度會改變答案:分數與花費一起變
Haiku 5.5 可以選擇推理強度,BazaarLink 目錄標示的預設強度是 medium。AA 對不同強度分別計分:
| 推理強度 | AA 智慧指數 | 每題平均花費 |
|---|---|---|
| Max | 43 | US$0.21 |
| High | 38 | US$0.08 |
| Medium | 34 | US$0.05 |
| Low | 29 | US$0.02 |
所以「Haiku 5.5 43 分」指的是 Max;用預設的 medium,AA 分數是 34,低於 GLM-5.3-Flash(42)、DeepSeek V4.1 Flash(39)與 MiMo-V2.6-Flash(38),不過每題花費也低很多。要拿四個模型比較,請固定推理強度,再用你自己的任務實測。
怎麼選
- 提示大多在 100K tokens 以內、要在這四個裡拿最高的 AA 分數: Haiku 5.5(Max)。要先確認你的任務能接受它較高的每題輸出量。
- 以每題花費優先: 看 AA 的每題花費,MiMo-V2.6-Flash 最低;它的 AutomationBench-AA 為 64%,Terminal-Bench 4.0 為 23%。
- 流程型 SaaS 自動化任務: 目前 AA 的 AutomationBench-AA 分數 DeepSeek V4.1 Flash 最高(69%),MiMo-V2.6-Flash 64%、GLM-5.3-Flash 60%;Haiku 5.5 的分數在 AA 重跑之前先不要參考。
- 長提示(超過 100K tokens)居多: Haiku 5.5 的價格是 5 倍,輸入 US$0.50、輸出 US$2.50,已不是這四個裡最低;其他三家沒有這個分級。
以上都是 AA 的單一測評組合與官方標價,不是對你任務的保證。建議挑一批代表性任務,固定推理強度並排測過,再決定要用哪一個。
在 BazaarLink 一起試
四個模型都可以用同一個 OpenAI 相容端點呼叫,只要換 model:
for MODEL in claude-haiku-5.5 deepseek-v4.1-flash glm-5.3-flash mimo-v2.6-flash; do
curl -s https://bazaarlink.ai/api/v1/chat/completions \
-H "Authorization: Bearer $BAZAARLINK_API_KEY" \
-H "Content-Type: application/json" \
-d "{\"model\": \"$MODEL\", \"messages\": [{\"role\": \"user\", \"content\": \"用三句話說明什麼是 prompt caching。\"}]}"
done
即時單價與規格請看 BazaarLink 模型目錄;如果你正在評估從 Haiku 4.5 升級,請看 Claude Haiku 4.5 要換 5.5 嗎?。
常見問題
Haiku 5.5 的 AA 智慧指數 43 是在哪個設定下? Max 推理強度。AA 對不同強度分別計分:Max 43、High 38、Medium 34、Low 29。
Haiku 5.5 為什麼 AutomationBench-AA 只有 35%? AA 表示這個分數很可能偏低,原因是發布前測試時的安全拒答問題讓模型過度拒答,Anthropic 正在修正,AA 計畫修正後重跑。
DeepSeek V4.1 Flash 在 BazaarLink 有分高峰離峰價嗎? BazaarLink 目錄上是單一價格,輸入 US$0.30、輸出 US$1.20,與官方高峰價相同。官方 API 的離峰價是高峰價的一半。
提示超過 100K tokens 會怎樣? Haiku 5.5 超過 100,000 tokens 的提示,輸入與輸出單價都變成 5 倍(US$0.50/US$2.50)。其他三個模型沒有這個分級。
這些分數可以代表我的任務嗎? 不能直接代表。AA 的指數是它自己的測評組合,請用自己的資料並排測試。
來源:Anthropic 定價頁、DeepSeek 定價頁、Z.ai 定價頁、小米 MiMo-V2.6-Flash 模型頁、AA 的 Haiku 5.5 vs GLM-5.3-Flash、vs DeepSeek V4.1 Flash、vs MiMo-V2.6-Flash 對比頁,以及 AA 的 Haiku 5.5(Max)、High、Medium、Low 與 Haiku 5.5 發布頁。查詢日 2026 年 10 月 8 日。