BazaarLinkBazaarLink
登入
所有文章
發布時間 2026-09-15 · · 作者BazaarLink · Prompt Caching · 提示快取 · AI API 折扣 · OpenAI · Claude · Gemini · DeepSeek · AI API 成本

Prompt caching 是什麼、能省多少?OpenAI/Claude/Gemini 三家規則對照、最短長度與保留時間、BazaarLink 快取單價與試算(2026)

Prompt caching 是唯一不用換模型、不用等批次就能拿到的 API 折扣,但三家的最短長度(1,024/4,096 token)、保留時間(30 分鐘/5 分鐘/1 小時)、寫入費(1.25×/2×)都不一樣,寫錯就是零折扣且不報錯。本文一張表對照三家規則,列出 BazaarLink 目錄的快取單價,用三個場景算出實際省多少,並如實說明平台端哪些系列有實際折扣樣本。

查詢日:2026-09-15。 三家的規則取自各自官方文件當日版本;快取單價取自 BazaarLink Models 目錄。快取規則改得很勤,動手前請再對一次。

Prompt caching(提示快取)是目前唯一不用換模型、不用等 24 小時、不用談判就能拿到的 API 折扣。它的原理一句話:每次請求裡重複出現的那段開頭——system prompt、工具定義、對話歷史、你貼進去的長文件——第二次以後不用重新付全價。

但它不是打開就有。三家的最短長度、保留時間、寫入費、要不要加參數都不一樣,寫錯一個就是零折扣、而且不會報錯。這篇把三家的規則放同一張表,給你我們目錄上的實際快取單價,最後算一次到底省多少。

一張表看三家規則

OpenAI(GPT-5.6+)Anthropic(Claude)Google(Gemini)
怎麼開預設開啟,不用加參數要加 cache_control:頂層加一次=自動放在最後一個可快取區塊;或逐區塊手動放2.5 以上預設隱式快取;另有顯式快取物件
最短長度1,024 tokenOpus 4.8/Sonnet 5 1,024;Haiku 4.5 4,096;Fable 5.1 5123.x Flash 與 3.1 Pro 4,096;2.5 系列 2,048
命中條件整個前綴完全相同(含工具定義、歷史)斷點之前的內容完全相同前綴相同
保留時間最近一次讀寫起 30 分鐘預設 5 分鐘;可選 1 小時隱式:自動;顯式:自訂 TTL
讀取價輸入的 0.1×輸入的 0.1×輸入的 10%(3.8 Flash $0.075)
寫入價輸入的 1.25×5 分鐘 TTL 1.25×;1 小時 TTL 隱式不另計;顯式按小時收儲存費(3.8 Flash $0.50/百萬 token/小時、3.1 Pro $4.50)
斷點上限最多 4 個
回應怎麼看有沒有命中usage.input_tokens_details.cached_tokensusage.cache_read_input_tokenscache_creation_input_tokens回應 usage 的快取欄位

三個最常踩的坑:

  1. 短於門檻的請求不會快取,也不會報錯。 Claude 的文件明說:低於最短長度時就算加了 cache_control 也不會快取、不回錯誤,要自己看 usage 欄位確認。Haiku 4.5 的門檻是 4,096,很多客服 Bot 的 system prompt 根本沒到。
  2. 前綴中間改一個字,後面全部失效。 快取是「從頭到某個點完全相同」,把會變的東西(日期、使用者名字)放在 system prompt 開頭,等於每次都寫新快取——而寫入是 1.25×,比不快取還貴
  3. 寫入不是免費的。 一段前綴只出現一次,你付的是 1.25×;要出現第二次才開始賺。Claude 的 1 小時 TTL 寫入是 2×,要重複更多次才划算。

透過 BazaarLink 呼叫時,快取讀取按下表計費,比對規則跟直購一致(同一個前綴、同一個最短長度)。

模型輸入快取讀取讀取=輸入的快取寫入
GPT-5.6 Sol$2.00$0.2010%$2.50
GPT-5.6 Terra$2.00$0.2010%$2.50
GPT-5.6 Luna$0.20$0.02010%$0.25
Claude Opus 4.8$5.00$0.5010%$6.25
Claude Sonnet 5$2.00$0.2010%$2.50
Claude Haiku 4.5$1.00$0.1010%$1.25
Gemini 3.8 Flash$0.75$0.07510%目錄未列
DeepSeek V4 Flash$0.20$0.03015%目錄未列
DeepSeek V4 Pro$2.40$0.146%目錄未列

平台實際有折到嗎? 我們看了過去 7 天平台計費的用量紀錄:OpenAI 系列有 246 筆、DeepSeek 2,600 筆、Gemini 74 筆請求命中快取,快取折扣都有實際入帳。Claude 系列這 7 天命中快取的請求全部是自帶金鑰(BYOK)的用量——那些錢是客戶付給 Anthropic 的,不經過我們計費,所以平台端目前沒有 Claude 的實際折扣樣本;上表的 Claude 快取價是目錄價,計費機制與其他三家相同。這點如實寫,不繞過去。

到底省多少:三個場景算給你看

場景 1:客服 Bot,60% 輸入命中快取(Claude Sonnet 5)

月輸入 13.5M、輸出 6.75M token。system prompt 加前幾輪歷史約佔輸入的 60%。

  • 不快取:13.5 × $2.00 + 6.75 × $10.00 = $94.5
  • 快取:13.5 × (40% × $2.00 + 60% × $0.20) + 6.75 × $10.00 = $79.9
  • 15%

場景 2:文件批次,長文件重複問多題,90% 輸入命中(GPT-5.6 Luna)

同一份 6,500 token 的文件問 10 個問題,文件本身第二題起全部命中。月輸入 19.5M、輸出 2.4M。

  • 不快取:$6.78;快取:$3.62;省 47%

場景 3:同樣的文件批次,換 DeepSeek V4 Flash

  • 不快取:$4.86;快取:$1.88;省 61%

三個場景說的是同一件事:省多少取決於「輸入佔帳單多少」×「輸入裡有多少重複」。 輸出主導的工作負載(生成長文、推理模型)快取幫不上忙;輸入主導又高度重複的(RAG、長文件多問、固定 system prompt 的客服)才是它的主場。

怎麼把前綴排對

順序永遠是:最不會變的放最前面。

  1. 工具定義(tool schema)
  2. system prompt 的固定部分
  3. 長文件/知識庫內容
  4. 對話歷史(舊的在前)
  5. 會變的東西放最後:當前日期、使用者名字、這一輪的問題

Claude 可以在 1~4 之間放最多 4 個斷點,讓變動頻率不同的段落各自快取;OpenAI 與 Gemini 沒有斷點,靠整個前綴自然對齊。

不用改。OpenAI 相容格式照送,快取的判定與計費在上游與我們的帳務層完成;回應的 usage 欄位會帶回快取 token 數,你可以在用量紀錄裡看到每筆請求命中了多少。價格全表在跨家價格比較,其他折扣機制(批次、離峰、用量回饋)那篇也一起講了——批次 API 我們沒有,需要的話那要直購。

FAQ

Prompt caching 是什麼?

把每次請求裡重複出現的開頭段落(system prompt、工具定義、對話歷史、長文件)快取起來,第二次以後按快取價計費而不是全價。OpenAI 與 Gemini 預設開啟,Claude 要加 cache_control。讀取價多數是輸入價的 10%;OpenAI 與 Claude 的寫入是 1.25×,所以前綴至少要重複出現兩次才划算。

Prompt caching 能省多少?

取決於輸入佔帳單多少、以及輸入裡有多少重複。客服 Bot 用 Claude Sonnet 5、60% 輸入命中,約省 15%;長文件多題問答用 GPT-5.6 Luna、90% 命中,約省 60% 以上的輸入費用。輸出不受快取影響,輸出主導的工作負載幾乎省不到。

為什麼我加了 cache_control 卻沒有折扣?

最常見是前綴短於最短長度:GPT-5.6 與 Claude Sonnet 5/Opus 4.8 是 1,024 token,Claude Haiku 4.5 與 Gemini 3.x 是 4,096。低於門檻不會快取也不會報錯,要看回應 usage 的快取欄位。第二常見是前綴中間有會變的內容(日期、使用者名),每次都變成新快取。

快取會保留多久?

OpenAI GPT-5.6 以上是最近一次讀寫起 30 分鐘;Claude 預設 5 分鐘、可選 1 小時(寫入變 2×);Gemini 隱式快取自動管理,顯式快取自訂 TTL 但按小時收儲存費。

透過 BazaarLink 呼叫,快取還有效嗎?

有效,且不用改程式。快取讀取按目錄上的快取價計費(GPT、Claude、Gemini 多數為輸入價的 10%,DeepSeek V4 Flash 15%)。過去 7 天平台計費的 OpenAI、DeepSeek、Gemini 請求都有實際的快取折扣入帳;Claude 這段期間命中快取的請求全是自帶金鑰用量,平台端尚無實際樣本,目錄價與計費機制與其他三家相同。

Gemini 的顯式快取和隱式快取差在哪?

隱式快取是 2.5 以上模型預設的,前綴達到最短長度(3.x Flash 與 3.1 Pro 為 4,096 token)自動命中、不另收費。顯式快取是你手動建立快取物件並指定 TTL,快取輸入同樣是 10%,但要按小時付儲存費(3.8 Flash 每百萬 token 每小時 $0.50、3.1 Pro $4.50)。

立即體驗 BazaarLink

台幣計費・統一發票・主流 AI 模型・OpenAI 相容 API

免費註冊 / 登入企業採購洽詢
相關文章
AI API 價格比較 · AI API 費用 · AI API 折扣 · AI API 成本 · Prompt Caching · GPT-5.6 · Claude · Gemini · DeepSeek · 台幣換算
2026 AI API 價格比較:GPT-5.6、Claude、Gemini、DeepSeek 台幣對照表,快取/批次/促銷/回饋四種折扣怎麼疊(含成本試算)
Claude API · Claude 費用 · Anthropic 定價 · 台幣換算 · Opus 5 · Sonnet 5 · Haiku 4.5
Claude API 台幣費用試算 2026 — Opus 5、Sonnet 5、Haiku 4.5 完整價目
GPT-5 API · OpenAI 定價 · GPT-5.6 · GPT-5.6 Sol · GPT-5.6 Terra · 台幣換算 · GPT 費用
GPT-5 API 台幣費用試算 2026 — GPT-5.6 Sol、Terra、Luna 完整價目
Gemini API · Gemini API 免費額度 · Gemini API 價格 · Gemini 費用 · Gemini 3.8 Flash · Gemini 3.1 Pro · Google 定價 · 台幣換算 · AI Studio
Gemini API 收費與免費額度 2026:價格、免費層現況、頻率限制與台幣試算(3.8 Flash/3.1 Pro/Flash-Lite)
客服
客服
您好!有什麼可以協助?
請留下訊息,我們會盡快回覆。