回應符合基準與安全門檻,未發現這一項風險。
中轉站完整性檢測
貼上 Base URL、API 金鑰與模型 ID,即可執行 95 項標準測試;需要時再加入 2 項選用測試,最多 97 項。報告會判斷模型真偽、Token 計量、提示注入、供應鏈與串流風險。
📢 🆕 新增模型判斷:Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 已納入完整判定鏈,並建立 google 家族首個 border-probe 分佈指紋叢集(V3H),可在同家族內分辨這兩款。冒名抽樣 18,000 次零誤認;非叢集成員一律回報「未確定」,不會被指名為這兩款。同批修復:風格訊號的短期波動不再能將誠實端點標為「已替換」。若您持有先前被標為已替換的報告,歡迎重新檢測。New: Gemini 3.6 Flash & Gemini 3.5 Flash-Lite are now fully supported, including border-probe fingerprinting.
| 模型 | 快速 | 完整 |
|---|---|---|
| gpt-4 | $0.870 | $1.260 |
| claude-opus-4.7 | $0.235 | $0.375 |
| claude-opus-4.6 | $0.235 | $0.375 |
| claude-sonnet-4.6 | $0.141 | $0.225 |
| gpt-5.4 | $0.133 | $0.215 |
| gpt-5.2 / 5.3-codex | $0.114 | $0.189 |
| gemini-3.1-pro | $0.106 | $0.172 |
| gpt-4o | $0.102 | $0.160 |
| claude-haiku-4.5 | $0.047 | $0.075 |
| gpt-5.4-mini | $0.040 | $0.065 |
| glm-5.1 | $0.035 | $0.054 |
| glm-5 | $0.026 | $0.040 |
| gpt-3.5-turbo | $0.018 | $0.026 |
檢測涵蓋範圍
報告狀態怎麼看
訊號不完整或接近門檻,需要查看原始回應與說明。
測試確認偏離基準、格式錯誤或存在完整性風險。
判定依據
以家族指紋、子模型特徵與反偽裝訊號交叉確認宣稱模型。
核對 Token 數、SSE 格式、延遲與回應結構,找出注水或中介層異常。
測試 System Prompt 注入、金鑰外洩、依賴劫持與簽名篡改風險。
本工具偵測的攻擊類型
本工具實作了論文 arXiv 2604.08407 所列 3 類關鍵的中轉站攻擊偵測 — 涵蓋依賴劫持、條件式 System Prompt 注入與金鑰外洩。每次預設執行 95 項標準探針,啟用延伸檢測時最多 97 項。
回應竄改
中轉站在「解析回應」階段主動修改 tool-call 或文字內容,讓 agent 執行攻擊者指定的操作。常見手法包含:竄改 npm/pip/go/cargo 安裝指令、注入 typosquatting 套件、改寫 shell command 參數。檢測方式為比對中轉站回應與直連模型的 tool-call payload,找出 silent rewrite。
條件注入
中轉站根據 prompt 內容條件式注入 system message — 對含「銀行」「密碼」「轉帳」等敏感詞的請求注入惡意指令,對普通請求則保持沉默。統計上呈現異常分布差異。檢測方式為 Proxy Monitor 比對 baseline 與待測中轉站的 system prompt 偏移量。
秘密掃描
中轉站在請求 (request) 與回應 (response) 兩端靜默掃描 API key、access token、個資、商業機密等敏感資訊,因為不修改內容因此一般 diff 工具偵測不到。檢測方式為注入 honeypot token 並驗證該 token 是否在中轉站日誌、Telegram bot、或外部 endpoint 出現。
常見問題
什麼是 AI API 中轉站檢測?
AI API 中轉站檢測是一套自動化測試流程,用來驗證你使用的 OpenAI 相容 API 端點是否誠實地執行請求。BazaarLink Probe 預設發送 95 項標準探針,另有 2 項延伸檢測(最多 97 項),偵測偷換模型、Token 灌水、System Prompt 注入與金鑰竊取,並輸出 0–100 評分。
怎麼判斷中轉站有沒有偷換模型?
最可靠的方法是使用模型指紋識別(model fingerprinting)探針:發送只有特定模型才能正確回答的問題(例如知識截止日期、特定能力測試),再比對回應是否符合你指定的模型。BazaarLink Probe 內建此類探針,自動判斷並標記偷換風險。
token 灌水是什麼?
Token 灌水(token padding)是指中轉站在 API 回傳的 usage 欄位中,虛報比實際消耗更高的 prompt_tokens 或 completion_tokens,使你多付費。輕微灌水(5–15%)難以肉眼察覺,BazaarLink Probe 透過精確計算已知 prompt 的 token 數來自動偵測。
API 延遲多少算正常?
一般而言,TTFT(Time to First Token)在 500ms 以內算正常;超過 2 秒表示中轉站可能有效能問題或額外的處理層。整體請求延遲視模型大小和輸出長度而定,GPT-4o 等大型模型平均 TTFT 約 300–800ms。BazaarLink Probe 的延遲測試會將你的端點與基準值對比。
BazaarLink Probe 和一般 ping 測試差在哪?
Ping 只測量網路連通性(ICMP 封包);BazaarLink Probe 則是完整的應用層(L7)測試,預設以 95 項標準探針驗證模型身份、Token 計算、拒答行為、串流格式與 System Prompt 注入,啟用延伸檢測時最多 97 項。這是 Ping 無法覆蓋的 AI API 專屬安全與品質驗證。
檢測結果可以怎麼用來選供應商?
將目標供應商的 API 端點輸入 BazaarLink Probe,對比各供應商的評分和風險標記。評分越高(越接近 100)、無紅色警示項目,代表該端點越可信。建議重點關注:模型真實性(是否偷換)、token 計算準確度(是否灌水)、延遲表現(TTFT)三大指標。
中轉站「降智」是什麼意思?怎麼檢測滿血還是摻假?
「降智」是社群對中轉站偷偷把你買的高階模型換成便宜模型的俗稱 —— 你付 Claude Opus 的錢,實際拿到的可能是 Haiku、GLM 或 DeepSeek,回答明顯變笨。「摻假」指同一個端點大部分時間給真模型、少部分請求偷偷換掉,最難察覺。判斷是不是「滿血」不能靠感覺,要靠行為指紋:BazaarLink Probe 送出只有特定模型答得出來的探針,比對回應分佈與官方基準,直接告訴你真偽。
Claude Code 接中轉站會被降智嗎?怎麼驗?
會,而且是最常見的情境。市面上不少便宜的 Claude 額度是從 Kiro、Antigravity、GitHub Copilot 等產品反代出來的,這些接口會自帶隱藏的 system prompt(我們實測抓到過一個端點每次請求夾帶約 2000 token 的system prompt,模型自稱「Kiro」並拒答所有非程式問題)。這種端點在 Claude Code 裡表現就是「變笨」。把該端點的 Base URL 與金鑰貼進 BazaarLink Probe,滲水偵測會直接量出被注入的 system prompt。
鏡像站、反代、中轉站有什麼差別?都能檢測嗎?
「中轉站」通常指自己接上游、以 OpenAI 相容格式轉售的服務;「反代」(反向代理)指直接把請求轉發到官方或某個產品的內部接口;「鏡像站」多半是前兩者的行銷說法。三者在協議層都是 OpenAI 相容端點,所以檢測方式相同 —— 只要給得出 Base URL 和金鑰,BazaarLink Probe 都能跑完整判定。