Prompt caching 是什麼、能省多少?OpenAI/Claude/Gemini 三家規則對照、最短長度與保留時間、BazaarLink 快取單價與試算(2026)
Prompt caching 是唯一不用換模型、不用等批次就能拿到的 API 折扣,但三家的最短長度(1,024/4,096 token)、保留時間(30 分鐘/5 分鐘/1 小時)、寫入費(1.25×/2×)都不一樣,寫錯就是零折扣且不報錯。本文一張表對照三家規則,列出 BazaarLink 目錄的快取單價,用三個場景算出實際省多少,並如實說明平台端哪些系列有實際折扣樣本。
查詢日:2026-09-15。 三家的規則取自各自官方文件當日版本;快取單價取自 BazaarLink Models 目錄。快取規則改得很勤,動手前請再對一次。
Prompt caching(提示快取)是目前唯一不用換模型、不用等 24 小時、不用談判就能拿到的 API 折扣。它的原理一句話:每次請求裡重複出現的那段開頭——system prompt、工具定義、對話歷史、你貼進去的長文件——第二次以後不用重新付全價。
但它不是打開就有。三家的最短長度、保留時間、寫入費、要不要加參數都不一樣,寫錯一個就是零折扣、而且不會報錯。這篇把三家的規則放同一張表,給你我們目錄上的實際快取單價,最後算一次到底省多少。
一張表看三家規則
| OpenAI(GPT-5.6+) | Anthropic(Claude) | Google(Gemini) | |
|---|---|---|---|
| 怎麼開 | 預設開啟,不用加參數 | 要加 cache_control:頂層加一次=自動放在最後一個可快取區塊;或逐區塊手動放 | 2.5 以上預設隱式快取;另有顯式快取物件 |
| 最短長度 | 1,024 token | Opus 4.8/Sonnet 5 1,024;Haiku 4.5 4,096;Fable 5.1 512 | 3.x Flash 與 3.1 Pro 4,096;2.5 系列 2,048 |
| 命中條件 | 整個前綴完全相同(含工具定義、歷史) | 斷點之前的內容完全相同 | 前綴相同 |
| 保留時間 | 最近一次讀寫起 30 分鐘 | 預設 5 分鐘;可選 1 小時 | 隱式:自動;顯式:自訂 TTL |
| 讀取價 | 輸入的 0.1× | 輸入的 0.1× | 輸入的 10%(3.8 Flash $0.075) |
| 寫入價 | 輸入的 1.25× | 5 分鐘 TTL 1.25×;1 小時 TTL 2× | 隱式不另計;顯式按小時收儲存費(3.8 Flash $0.50/百萬 token/小時、3.1 Pro $4.50) |
| 斷點上限 | — | 最多 4 個 | — |
| 回應怎麼看有沒有命中 | usage.input_tokens_details.cached_tokens | usage.cache_read_input_tokens、cache_creation_input_tokens | 回應 usage 的快取欄位 |
三個最常踩的坑:
- 短於門檻的請求不會快取,也不會報錯。 Claude 的文件明說:低於最短長度時就算加了
cache_control也不會快取、不回錯誤,要自己看 usage 欄位確認。Haiku 4.5 的門檻是 4,096,很多客服 Bot 的 system prompt 根本沒到。 - 前綴中間改一個字,後面全部失效。 快取是「從頭到某個點完全相同」,把會變的東西(日期、使用者名字)放在 system prompt 開頭,等於每次都寫新快取——而寫入是 1.25×,比不快取還貴。
- 寫入不是免費的。 一段前綴只出現一次,你付的是 1.25×;要出現第二次才開始賺。Claude 的 1 小時 TTL 寫入是 2×,要重複更多次才划算。
BazaarLink 上的快取單價(每百萬 token)
透過 BazaarLink 呼叫時,快取讀取按下表計費,比對規則跟直購一致(同一個前綴、同一個最短長度)。
| 模型 | 輸入 | 快取讀取 | 讀取=輸入的 | 快取寫入 |
|---|---|---|---|---|
| GPT-5.6 Sol | $2.00 | $0.20 | 10% | $2.50 |
| GPT-5.6 Terra | $2.00 | $0.20 | 10% | $2.50 |
| GPT-5.6 Luna | $0.20 | $0.020 | 10% | $0.25 |
| Claude Opus 4.8 | $5.00 | $0.50 | 10% | $6.25 |
| Claude Sonnet 5 | $2.00 | $0.20 | 10% | $2.50 |
| Claude Haiku 4.5 | $1.00 | $0.10 | 10% | $1.25 |
| Gemini 3.8 Flash | $0.75 | $0.075 | 10% | 目錄未列 |
| DeepSeek V4 Flash | $0.20 | $0.030 | 15% | 目錄未列 |
| DeepSeek V4 Pro | $2.40 | $0.14 | 6% | 目錄未列 |
平台實際有折到嗎? 我們看了過去 7 天平台計費的用量紀錄:OpenAI 系列有 246 筆、DeepSeek 2,600 筆、Gemini 74 筆請求命中快取,快取折扣都有實際入帳。Claude 系列這 7 天命中快取的請求全部是自帶金鑰(BYOK)的用量——那些錢是客戶付給 Anthropic 的,不經過我們計費,所以平台端目前沒有 Claude 的實際折扣樣本;上表的 Claude 快取價是目錄價,計費機制與其他三家相同。這點如實寫,不繞過去。
到底省多少:三個場景算給你看
場景 1:客服 Bot,60% 輸入命中快取(Claude Sonnet 5)
月輸入 13.5M、輸出 6.75M token。system prompt 加前幾輪歷史約佔輸入的 60%。
- 不快取:13.5 × $2.00 + 6.75 × $10.00 = $94.5
- 快取:13.5 × (40% × $2.00 + 60% × $0.20) + 6.75 × $10.00 = $79.9
- 省 15%
場景 2:文件批次,長文件重複問多題,90% 輸入命中(GPT-5.6 Luna)
同一份 6,500 token 的文件問 10 個問題,文件本身第二題起全部命中。月輸入 19.5M、輸出 2.4M。
- 不快取:$6.78;快取:$3.62;省 47%
場景 3:同樣的文件批次,換 DeepSeek V4 Flash
- 不快取:$4.86;快取:$1.88;省 61%
三個場景說的是同一件事:省多少取決於「輸入佔帳單多少」×「輸入裡有多少重複」。 輸出主導的工作負載(生成長文、推理模型)快取幫不上忙;輸入主導又高度重複的(RAG、長文件多問、固定 system prompt 的客服)才是它的主場。
怎麼把前綴排對
順序永遠是:最不會變的放最前面。
- 工具定義(tool schema)
- system prompt 的固定部分
- 長文件/知識庫內容
- 對話歷史(舊的在前)
- 會變的東西放最後:當前日期、使用者名字、這一輪的問題
Claude 可以在 1~4 之間放最多 4 個斷點,讓變動頻率不同的段落各自快取;OpenAI 與 Gemini 沒有斷點,靠整個前綴自然對齊。
用 BazaarLink 呼叫時要改什麼
不用改。OpenAI 相容格式照送,快取的判定與計費在上游與我們的帳務層完成;回應的 usage 欄位會帶回快取 token 數,你可以在用量紀錄裡看到每筆請求命中了多少。價格全表在跨家價格比較,其他折扣機制(批次、離峰、用量回饋)那篇也一起講了——批次 API 我們沒有,需要的話那要直購。
FAQ
Prompt caching 是什麼?
把每次請求裡重複出現的開頭段落(system prompt、工具定義、對話歷史、長文件)快取起來,第二次以後按快取價計費而不是全價。OpenAI 與 Gemini 預設開啟,Claude 要加 cache_control。讀取價多數是輸入價的 10%;OpenAI 與 Claude 的寫入是 1.25×,所以前綴至少要重複出現兩次才划算。
Prompt caching 能省多少?
取決於輸入佔帳單多少、以及輸入裡有多少重複。客服 Bot 用 Claude Sonnet 5、60% 輸入命中,約省 15%;長文件多題問答用 GPT-5.6 Luna、90% 命中,約省 60% 以上的輸入費用。輸出不受快取影響,輸出主導的工作負載幾乎省不到。
為什麼我加了 cache_control 卻沒有折扣?
最常見是前綴短於最短長度:GPT-5.6 與 Claude Sonnet 5/Opus 4.8 是 1,024 token,Claude Haiku 4.5 與 Gemini 3.x 是 4,096。低於門檻不會快取也不會報錯,要看回應 usage 的快取欄位。第二常見是前綴中間有會變的內容(日期、使用者名),每次都變成新快取。
快取會保留多久?
OpenAI GPT-5.6 以上是最近一次讀寫起 30 分鐘;Claude 預設 5 分鐘、可選 1 小時(寫入變 2×);Gemini 隱式快取自動管理,顯式快取自訂 TTL 但按小時收儲存費。
透過 BazaarLink 呼叫,快取還有效嗎?
有效,且不用改程式。快取讀取按目錄上的快取價計費(GPT、Claude、Gemini 多數為輸入價的 10%,DeepSeek V4 Flash 15%)。過去 7 天平台計費的 OpenAI、DeepSeek、Gemini 請求都有實際的快取折扣入帳;Claude 這段期間命中快取的請求全是自帶金鑰用量,平台端尚無實際樣本,目錄價與計費機制與其他三家相同。
Gemini 的顯式快取和隱式快取差在哪?
隱式快取是 2.5 以上模型預設的,前綴達到最短長度(3.x Flash 與 3.1 Pro 為 4,096 token)自動命中、不另收費。顯式快取是你手動建立快取物件並指定 TTL,快取輸入同樣是 10%,但要按小時付儲存費(3.8 Flash 每百萬 token 每小時 $0.50、3.1 Pro $4.50)。