中轉站完整性檢測

貼上 Base URL、API 金鑰與模型 ID,即可執行 95 項標準測試;需要時再加入 2 項選用測試,最多 97 項。報告會判斷模型真偽、Token 計量、提示注入、供應鏈與串流風險。

📢 🆕 新增模型判斷:Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 已納入完整判定鏈,並建立 google 家族首個 border-probe 分佈指紋叢集(V3H),可在同家族內分辨這兩款。冒名抽樣 18,000 次零誤認;非叢集成員一律回報「未確定」,不會被指名為這兩款。同批修復:風格訊號的短期波動不再能將誠實端點標為「已替換」。若您持有先前被標為已替換的報告,歡迎重新檢測。New: Gemini 3.6 Flash & Gemini 3.5 Flash-Lite are now fully supported, including border-probe fingerprinting.

歷史記錄
尚無記錄
Step 1 — 設定端點
請使用可撤銷的測試專用 Key金鑰會傳送至 BazaarLink Probe 伺服器,僅用於本次檢測,不會作為端點監控憑證重複使用。建議使用低額度 Key,完成後立即撤銷。
過去 24 小時
測試次數
中轉站數
0時 23時
Probe 測試費用估算
完整 Probe 最多執行 97 項;實際費用依模型與上游定價計算。
快速模式 ~17K 輸入 + ~6K 輸出 / 完整模式 ~20K + ~11K(含 10× 語言指紋)
模型快速完整
gpt-4$0.870$1.260
claude-opus-4.7$0.235$0.375
claude-opus-4.6$0.235$0.375
claude-sonnet-4.6$0.141$0.225
gpt-5.4$0.133$0.215
gpt-5.2 / 5.3-codex$0.114$0.189
gemini-3.1-pro$0.106$0.172
gpt-4o$0.102$0.160
claude-haiku-4.5$0.047$0.075
gpt-5.4-mini$0.040$0.065
glm-5.1$0.035$0.054
glm-5$0.026$0.040
gpt-3.5-turbo$0.018$0.026
費用依 上游 即時定價,包含語言指紋 ×10 重複呼叫。實際費用可能因回應長度略有浮動。
ResearcharXiv 2604.08407 — LLM 中轉站供應鏈攻擊研究論文Twitter / X — BazaarLink 相關討論arXiv 2407.15847 — LLMmap:大型語言模型指紋識別arXiv 2604.24827 — IKP:透過事實容量估算黑盒 LLM 參數量OWASP LLM Top 10 — LLM 應用十大安全風險

我們如何判定

1出題實測最多 97 道題2認出哪一家OpenAI?Claude?3認出哪一款家族內找型號4雙胞胎複驗相似款再分辨5對答案實測 vs 宣稱
30
個判斷分支
8
種可能結論
0
採信商家自稱
展開完整判定樹,看三種結果怎麼走出來
判定樹五個階段的所有分支,以及實際走過的路徑① 出題實測1.1全部答完1.2少量缺題 <10%1.3缺 ≥10% 只認家1.4端點失效② 認出哪一家2.1中文自稱直判2.2行為指紋主判2.3證據不足棄權MOD矛盾守衛降級③ 認出哪一款3.1採 Scoped3.2跨家族改判3.3空拒答佐證3.4跨家族救援3.5提拔 Global3.6IKP 最後防線3.7棄權只認家M1V3F 仲裁M2行為家族否決④ 雙胞胎複驗4.1全過 → 確認4.2全過 → 推翻4.3gate 未過4.4H1 保護不推翻4.5基準過期⑤ 對答案5.1完全相符5.2只有家族相符5.3款式不符5.4換模5.5自稱被偽造5.6行為被誘導5.7資料不足5.8模稜兩可
相符不斷定不符灰色 = 這次沒走到的分支點任一節點看說明
題目全部答完,家族與款式一路對上,複驗也確認 → 完全相符。
實際路徑 1.1 → 2.2 → 3.1 → 4.1 → 5.1

檢測涵蓋範圍

報告狀態怎麼看

通過

回應符合基準與安全門檻,未發現這一項風險。

警告

訊號不完整或接近門檻,需要查看原始回應與說明。

未通過

測試確認偏離基準、格式錯誤或存在完整性風險。

判定依據

模型身分

以家族指紋、子模型特徵與反偽裝訊號交叉確認宣稱模型。

計量與傳輸

核對 Token 數、SSE 格式、延遲與回應結構,找出注水或中介層異常。

安全與供應鏈

測試 System Prompt 注入、金鑰外洩、依賴劫持與簽名篡改風險。

本工具偵測的攻擊類型

本工具實作了論文 arXiv 2604.08407 所列 3 類關鍵的中轉站攻擊偵測 — 涵蓋依賴劫持、條件式 System Prompt 注入與金鑰外洩。每次預設執行 95 項標準探針,啟用延伸檢測時最多 97 項。

AC-1.a

回應竄改

中轉站在「解析回應」階段主動修改 tool-call 或文字內容,讓 agent 執行攻擊者指定的操作。常見手法包含:竄改 npm/pip/go/cargo 安裝指令、注入 typosquatting 套件、改寫 shell command 參數。檢測方式為比對中轉站回應與直連模型的 tool-call payload,找出 silent rewrite。

AC-1.b

條件注入

中轉站根據 prompt 內容條件式注入 system message — 對含「銀行」「密碼」「轉帳」等敏感詞的請求注入惡意指令,對普通請求則保持沉默。統計上呈現異常分布差異。檢測方式為 Proxy Monitor 比對 baseline 與待測中轉站的 system prompt 偏移量。

AC-2

秘密掃描

中轉站在請求 (request) 與回應 (response) 兩端靜默掃描 API key、access token、個資、商業機密等敏感資訊,因為不修改內容因此一般 diff 工具偵測不到。檢測方式為注入 honeypot token 並驗證該 token 是否在中轉站日誌、Telegram bot、或外部 endpoint 出現。

常見問題

什麼是 AI API 中轉站檢測?

AI API 中轉站檢測是一套自動化測試流程,用來驗證你使用的 OpenAI 相容 API 端點是否誠實地執行請求。BazaarLink Probe 預設發送 95 項標準探針,另有 2 項延伸檢測(最多 97 項),偵測偷換模型、Token 灌水、System Prompt 注入與金鑰竊取,並輸出 0–100 評分。

怎麼判斷中轉站有沒有偷換模型?

最可靠的方法是使用模型指紋識別(model fingerprinting)探針:發送只有特定模型才能正確回答的問題(例如知識截止日期、特定能力測試),再比對回應是否符合你指定的模型。BazaarLink Probe 內建此類探針,自動判斷並標記偷換風險。

token 灌水是什麼?

Token 灌水(token padding)是指中轉站在 API 回傳的 usage 欄位中,虛報比實際消耗更高的 prompt_tokens 或 completion_tokens,使你多付費。輕微灌水(5–15%)難以肉眼察覺,BazaarLink Probe 透過精確計算已知 prompt 的 token 數來自動偵測。

API 延遲多少算正常?

一般而言,TTFT(Time to First Token)在 500ms 以內算正常;超過 2 秒表示中轉站可能有效能問題或額外的處理層。整體請求延遲視模型大小和輸出長度而定,GPT-4o 等大型模型平均 TTFT 約 300–800ms。BazaarLink Probe 的延遲測試會將你的端點與基準值對比。

BazaarLink Probe 和一般 ping 測試差在哪?

Ping 只測量網路連通性(ICMP 封包);BazaarLink Probe 則是完整的應用層(L7)測試,預設以 95 項標準探針驗證模型身份、Token 計算、拒答行為、串流格式與 System Prompt 注入,啟用延伸檢測時最多 97 項。這是 Ping 無法覆蓋的 AI API 專屬安全與品質驗證。

檢測結果可以怎麼用來選供應商?

將目標供應商的 API 端點輸入 BazaarLink Probe,對比各供應商的評分和風險標記。評分越高(越接近 100)、無紅色警示項目,代表該端點越可信。建議重點關注:模型真實性(是否偷換)、token 計算準確度(是否灌水)、延遲表現(TTFT)三大指標。

中轉站「降智」是什麼意思?怎麼檢測滿血還是摻假?

「降智」是社群對中轉站偷偷把你買的高階模型換成便宜模型的俗稱 —— 你付 Claude Opus 的錢,實際拿到的可能是 Haiku、GLM 或 DeepSeek,回答明顯變笨。「摻假」指同一個端點大部分時間給真模型、少部分請求偷偷換掉,最難察覺。判斷是不是「滿血」不能靠感覺,要靠行為指紋:BazaarLink Probe 送出只有特定模型答得出來的探針,比對回應分佈與官方基準,直接告訴你真偽。

Claude Code 接中轉站會被降智嗎?怎麼驗?

會,而且是最常見的情境。市面上不少便宜的 Claude 額度是從 Kiro、Antigravity、GitHub Copilot 等產品反代出來的,這些接口會自帶隱藏的 system prompt(我們實測抓到過一個端點每次請求夾帶約 2000 token 的system prompt,模型自稱「Kiro」並拒答所有非程式問題)。這種端點在 Claude Code 裡表現就是「變笨」。把該端點的 Base URL 與金鑰貼進 BazaarLink Probe,滲水偵測會直接量出被注入的 system prompt。

鏡像站、反代、中轉站有什麼差別?都能檢測嗎?

「中轉站」通常指自己接上游、以 OpenAI 相容格式轉售的服務;「反代」(反向代理)指直接把請求轉發到官方或某個產品的內部接口;「鏡像站」多半是前兩者的行銷說法。三者在協議層都是 OpenAI 相容端點,所以檢測方式相同 —— 只要給得出 Base URL 和金鑰,BazaarLink Probe 都能跑完整判定。

延伸閱讀

Claude 降智是真的嗎?三種檢測方法,驗出滿血還是摻假「降智」是中轉站把你買的高階模型換成便宜模型的俗稱。本文說明降智與摻假的差別、為什麼靠感覺判斷不可靠,以及三種可實際操作的檢測方法。怎麼判斷 AI API 中轉站靠不靠譜?倍率、跑路風險與摻假的判讀選中轉站不只看價格。本文整理倍率怎麼讀、哪些訊號預示跑路風險、摻假為什麼比全部失敗更危險,以及一份可操作的驗證清單。Claude Code 接中轉站會降智嗎?反代與隱藏 system prompt 實測Claude Code 走中轉站變笨,多半不是模型問題,而是反代接口自帶的隱藏 system prompt 在干擾。本文說明反代的來源、為什麼會影響效果,以及怎麼驗。Token 灌水是什麼?如何檢測 API 是否灌 Token(2026 完整指南)Token 灌水(token padding)是 AI API 中轉站透過多算 token 數量來謀取利益的手法。本文解釋原理、辨識方式與用 BazaarLink Probe 一鍵檢測的方法。
回到 BazaarLink 首頁