回應符合基準與安全門檻,未發現這一項風險。
中轉站檢測:降智、摻假與偷換模型
貼上 Base URL 與 API 金鑰,96 項檢測找出降智、摻假與偷換模型。
熱門中轉站檢測
我們如何判定
展開完整判定樹,看三種結果怎麼走出來
判定方法與能力邊界
我們不問「你是哪個模型」——任何端點都能回答任何名字。我們送出 96 項標準檢測讓它做事,再拿它做事的方式,跟我們手上已知模型的基準比對。判定分五站,由粗到細,每一站都可以說「證據不夠,我不斷定」。
五站怎麼收斂
- ①出題實測
這個端點到底能不能被量測?
判定的第一個前提是題目真的答完了。缺題不只是資料少,而是剩下的證據可能剛好都偏向同一邊——那是抽樣偏差,不是證據。
端點完全沒有回應,或金鑰、模型名稱根本不通,就直接停下,不用剩下的殘缺資料硬湊一個結論。
- ②認出哪一家
這是哪一家做出來的模型?
最常見的偷換是跨家族的——拿便宜的模型冒充貴的。家族層的行為特徵最穩定、最難假裝,所以先問這一層。我們比對的是回答的風格與習慣,不是它自稱什麼;自稱是整份報告裡最容易偽造的一項。
沒有足夠的家族證據就棄權,不硬指認。遇到「中文自稱一家、行為像另一家」的矛盾時,我們判它是口誤,退回行為證據,而不是採信自稱。
- ③認出哪一款
同一家裡面,是哪一個型號?
你買的是特定型號,不是「那一家的某個模型」。所謂「降智」多半發生在這一層:家族沒換,換成同家族更便宜的小號。我們同時做家族內比對與跨家族比對,兩份結果互相檢查——家族一旦判錯,家族內比對會非常有信心地給出錯的型號。
證據只夠到家族層時,報告會明講「只認得出是哪一家,認不出是哪一款」,而不是挑一個最像的填上去。
- ④雙胞胎複驗
上一站選出來的那一款,跟它的近親真的分得開嗎?
有些型號是雙胞胎:風格、能力、慣用句式高度重疊,上一站在它們之間幾乎沒有鑑別力,分數會很接近但那個接近沒有意義。這一站只做一件事——對這些成群的近親,用另一組專為它們設計的題目重新採樣,看整體分佈而不是看單題。過了,就確認或推翻上一站;沒過,就維持上一站的結果。
這一站有一個刻意的不對稱:當證據不夠決定性、而上一站的結果又剛好和商家宣稱一致時,我們不推翻。誣告一個誠實的商家,代價比漏抓一次高。
- ⑤對答案
實測結果跟商家宣稱的,差在哪裡?
辨認的過程本身不看商家宣稱什麼——前面幾站比對的都是行為證據。宣稱只在兩個地方進場:第四站決定「要不要推翻」的時候,以及這一站。這個順序是刻意的——先得出答案再去對題目,才不會被宣稱牽著走。結論分成完全相符、只有家族相符、款式不符、換模、自稱被偽造、行為被誘導、資料不足、模稜兩可。
訊號互相衝突而沒有穩定多數時,結論就是「模稜兩可」。它是一個正式結論,不是系統壞掉。
為什麼我們常常說「無法判定」
因為兩個方向的錯誤代價不對稱。說一個誠實的中轉站偷換模型,是一項指控,會實際傷害到人;而漏抓一次,你可以再測一次、也可以看它的歷史紀錄。所以在證據不足時,我們選擇不斷定。
這件事在程式裡是有形狀的:只有引擎「確認」發生替換時,報告才會畫出「模型不符」。單純「最相似的那個模型剛好跟宣稱不同」不會被畫成指控——那只是我們的猜測。看到「未確定」,正確的讀法是「這次的證據不足以下判斷」,它既不是清白證明,也不是有罪判決。
報告上的數字怎麼讀
- 0–100 分
- 這是品質分,不是身分判定。它只計算安全、完整性、品質那幾類題目;身分題全部不計分,因為身分是「是或不是」,不是「幾分」。所以只跑身分題的快速模式,分數必定是 0——那是「沒考這張考卷」,不是「考了 0 分」。要看品質分,請跑完整的 96 項標準檢測。
- 判定強度
- 指的是「這一次」的證據有多強:題目答得夠不夠完整、各項訊號有沒有指向同一個方向、近親之間的差距夠不夠大。它會隨每次檢測變動,不是這個模型的固定屬性。
- 歷史準確率
- 指的是「這套方法」在已知答案的樣本上量出來的表現,是離線算的,跟你這次的檢測無關。它不能被讀成「這次判定正確的機率」——兩個數字回答的是不同的問題,不可以互換使用。
我們做不到什麼
以下是我們已知的能力邊界。寫出來,是因為一份不講邊界的報告會讓你高估它。
- 我們只看得見這一次呼叫
一次檢測就是一次抽樣。中轉站可以只對一部分流量偷換,也可以在流量特徵像檢測時切回正貨。單次通過不等於長期誠實——請定期重測,並且看它的歷史紀錄而不是單一份報告。
- 分辨近親型號有天花板
當冒充者刻意模仿到一半以上的行為時,證據會有大約一半天然指向它宣稱的身分。這是結構性的上限,不是題目出得不夠多——我們實測過加題,成本大幅上升而分辨能力幾乎不動。
- 我們不能證明「絕對沒換」
判定為相符的意思是「這次的證據不支持偷換」,不是「保證沒有偷換」。任何宣稱能給出保證的檢測,都是在誇大自己。
- 舊報告會少標一些細節
判定路徑是事後從存檔資料重建的,引擎當下並不記錄自己走了哪一條規則。有些分支在存檔裡留不下足以區分的痕跡,這時我們只打亮結果、不標規則編號。寧可少講,也不猜。
檢測涵蓋範圍
報告狀態怎麼看
訊號不完整或接近門檻,需要查看原始回應與說明。
測試確認偏離基準、格式錯誤或存在完整性風險。
判定依據
以家族指紋、子模型特徵與反偽裝訊號交叉確認宣稱模型。
核對 Token 數、SSE 格式、延遲與回應結構,找出注水或中介層異常。
測試 System Prompt 注入、金鑰外洩、依賴劫持與簽名篡改風險。
本工具偵測的攻擊類型
本工具實作了論文 arXiv 2604.08407 所列 3 類關鍵的中轉站攻擊偵測 — 涵蓋依賴劫持、條件式 System Prompt 注入與金鑰外洩。每次預設執行 96 項標準探針,啟用延伸檢測時最多 98 項。
回應竄改
中轉站在「解析回應」階段主動修改 tool-call 或文字內容,讓 agent 執行攻擊者指定的操作。常見手法包含:竄改 npm/pip/go/cargo 安裝指令、注入 typosquatting 套件、改寫 shell command 參數。檢測方式為比對中轉站回應與直連模型的 tool-call payload,找出 silent rewrite。
條件注入
中轉站根據 prompt 內容條件式注入 system message — 對含「銀行」「密碼」「轉帳」等敏感詞的請求注入惡意指令,對普通請求則保持沉默。統計上呈現異常分布差異。檢測方式為 Proxy Monitor 比對 baseline 與待測中轉站的 system prompt 偏移量。
秘密掃描
中轉站在請求 (request) 與回應 (response) 兩端靜默掃描 API key、access token、個資、商業機密等敏感資訊,因為不修改內容因此一般 diff 工具偵測不到。檢測方式為注入 honeypot token 並驗證該 token 是否在中轉站日誌、Telegram bot、或外部 endpoint 出現。
常見問題
什麼是 AI API 中轉站檢測?
AI API 中轉站檢測是一套自動化測試流程,用來驗證你使用的 OpenAI 相容 API 端點是否誠實地執行請求。BazaarLink Probe 預設發送 96 項標準探針,另有 2 項延伸檢測(最多 98 項),偵測偷換模型、Token 灌水、System Prompt 注入與金鑰竊取,並輸出 0–100 評分。
怎麼判斷中轉站有沒有偷換模型?
最可靠的方法是使用模型指紋識別(model fingerprinting)探針:發送只有特定模型才能正確回答的問題(例如知識截止日期、特定能力測試),再比對回應是否符合你指定的模型。BazaarLink Probe 內建此類探針,自動判斷並標記偷換風險。
token 灌水是什麼?
Token 灌水(token padding)是指中轉站在 API 回傳的 usage 欄位中,虛報比實際消耗更高的 prompt_tokens 或 completion_tokens,使你多付費。輕微灌水(5–15%)難以肉眼察覺,BazaarLink Probe 透過精確計算已知 prompt 的 token 數來自動偵測。
API 延遲多少算正常?
一般而言,TTFT(Time to First Token)在 500ms 以內算正常;超過 2 秒表示中轉站可能有效能問題或額外的處理層。整體請求延遲視模型大小和輸出長度而定,GPT-4o 等大型模型平均 TTFT 約 300–800ms。BazaarLink Probe 的延遲測試會將你的端點與基準值對比。
BazaarLink Probe 和一般 ping 測試差在哪?
Ping 只測量網路連通性(ICMP 封包);BazaarLink Probe 則是完整的應用層(L7)測試,預設以 96 項標準探針驗證模型身份、Token 計算、拒答行為、串流格式與 System Prompt 注入,啟用延伸檢測時最多 98 項。這是 Ping 無法覆蓋的 AI API 專屬安全與品質驗證。
檢測結果可以怎麼用來選供應商?
將目標供應商的 API 端點輸入 BazaarLink Probe,對比各供應商的評分和風險標記。評分越高(越接近 100)、無紅色警示項目,代表該端點越可信。建議重點關注:模型真實性(是否偷換)、token 計算準確度(是否灌水)、延遲表現(TTFT)三大指標。
中轉站「降智」是什麼意思?怎麼檢測滿血還是摻假?
「降智」是社群對中轉站偷偷把你買的高階模型換成便宜模型的俗稱 —— 你付 Claude Opus 的錢,實際拿到的可能是 Haiku、GLM 或 DeepSeek,回答明顯變笨。「摻假」指同一個端點大部分時間給真模型、少部分請求偷偷換掉,最難察覺。判斷是不是「滿血」不能靠感覺,要靠行為指紋:BazaarLink Probe 送出只有特定模型答得出來的探針,比對回應分佈與官方基準,直接告訴你真偽。
Claude Code 接中轉站會被降智嗎?怎麼驗?
會,而且是最常見的情境。市面上不少便宜的 Claude 額度是從 Kiro、Antigravity、GitHub Copilot 等產品反代出來的,這些接口會自帶隱藏的 system prompt(我們實測抓到過一個端點每次請求夾帶約 2000 token 的system prompt,模型自稱「Kiro」並拒答所有非程式問題)。這種端點在 Claude Code 裡表現就是「變笨」。把該端點的 Base URL 與金鑰貼進 BazaarLink Probe,滲水偵測會直接量出被注入的 system prompt。
鏡像站、反代、中轉站有什麼差別?都能檢測嗎?
「中轉站」通常指自己接上游、以 OpenAI 相容格式轉售的服務;「反代」(反向代理)指直接把請求轉發到官方或某個產品的內部接口;「鏡像站」多半是前兩者的行銷說法。三者在協議層都是 OpenAI 相容端點,所以檢測方式相同 —— 只要給得出 Base URL 和金鑰,BazaarLink Probe 都能跑完整判定。