BazaarLinkBazaarLink
ログイン

LLM API リレー品質チェック

📢 🆕 新增模型判斷:Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 已納入完整判定鏈,並建立 google 家族首個 border-probe 分佈指紋叢集(V3H),可在同家族內分辨這兩款。冒名抽樣 18,000 次零誤認;非叢集成員一律回報「未確定」,不會被指名為這兩款。同批修復:風格訊號的短期波動不再能將誠實端點標為「已替換」。若您持有先前被標為已替換的報告,歡迎重新檢測。New: Gemini 3.6 Flash & Gemini 3.5 Flash-Lite are now fully supported, including border-probe fingerprinting.

OpenAI 互換の API リレー・リバースプロキシを検査 — 76 項目の自動テストでモデルのすり替え・Token 水増し・System Prompt 注入・依存関係ハイジャック(AC-1.a)・署名改ざん(AC-5)リスクを検出します。

履歴
記録はまだありません
Step 1 — エンドポイントを設定
過去 24 時間
テスト回数
リレー数
0時 23時
Probe テストコスト見積もり
フル Probe テスト(76 項目)あたりの推定 API コスト。OpenRouter 料金に基づき計算されます。コストはテスト対象モデルによって異なり、API キーのアカウントに課金されます。
クイック ~17K 入力 + ~6K 出力 / 完全 ~20K + ~11K(10× 言語指紋含む)
モデルクイック完全
gpt-4$0.870$1.260
claude-opus-4.7$0.235$0.375
claude-opus-4.6$0.235$0.375
claude-sonnet-4.6$0.141$0.225
gpt-5.4$0.133$0.215
gpt-5.2 / 5.3-codex$0.114$0.189
gemini-3.1-pro$0.106$0.172
gpt-4o$0.102$0.160
claude-haiku-4.5$0.047$0.075
gpt-5.4-mini$0.040$0.065
glm-5.1$0.035$0.054
glm-5$0.026$0.040
gpt-3.5-turbo$0.018$0.026
OpenRouter のリアルタイム料金に基づいています。言語フィンガープリント ×10 の繰り返し呼び出しを含みます。実際のコストは応答の長さにより若干変動する場合があります。
リサーチarXiv 2604.08407 — LLM サプライチェーン攻撃研究Twitter / X — BazaarLink ディスカッションarXiv 2407.15847 — LLMmap:大規模言語モデルの指紋識別arXiv 2604.24827 — IKP:事実容量によるブラックボックス LLM パラメータ数推定OWASP LLM Top 10 — LLM アプリケーションのトップ10セキュリティリスク

判定の仕組み

1テストを実施最大97問2どの会社か判定OpenAIか、Claudeか?3どのモデルか判定同じ会社の中から型番を特定4似た者同士を再確認似ているモデルを見分ける5答え合わせ実測 vs 申告
30
個の判断分岐
8
通りの結論
0
業者の自己申告をそのまま信じた回数
判定ツリーを展開して、3つの結果がどのように導かれるか確認する
判定ツリー5段階すべての分岐と、実際に通った経路① テストを実施1.1全問回答1.2一部未回答 <10%1.310%以上欠落、会社のみ判定10%以上欠落、会社の…1.4エンドポイント無応答② どの会社か判定2.1中国語の自己申告で即決2.2行動指紋で判定2.3証拠不足で保留MOD矛盾ガードで格下げ③ どのモデルか判定3.1Scoped を採用3.2他社照合で覆す3.3拒否応答の裏付け3.4他社照合で救済3.5Global に格上げ3.6IKP を最終防衛線に3.7保留、会社のみ判定M1V3F で裁定M2行動証拠による拒否権④ 似た者同士を再確認4.1全通過 → 確定4.2全通過 → 覆す4.3gate 未通過4.4H1 保護、覆さない4.5基準が古い⑤ 答え合わせ5.1完全一致5.2会社のみ一致5.3モデルが不一致5.4モデルすり替え5.5自己申告が偽装5.6行動が誘導された5.7データ不足5.8判断つかず
一致未確定不一致グレー = 今回通らなかった分岐ノードをクリックすると説明が見られます
設問にすべて回答があり、会社もモデルも一貫して一致、再確認でも確定 → 完全一致。
実際の経路 1.1 → 2.2 → 3.1 → 4.1 → 5.1

このツールが検出する攻撃の種類

このプローブは、arXiv 2604.08407 に記載されている 3 つの主要なリレー攻撃クラスの検出を実装しています — サプライチェーンインジェクション、条件付き system prompt インジェクション、認証情報の漏洩。各テスト実行では、これらの攻撃面を明らかにするために 50 以上の probe をエンドポイントに対して実行します。

AC-1.a

レスポンス改ざん

プロキシがレスポンス解析中に tool-call やテキストコンテンツを改変し、エージェントに攻撃者が指定した操作を実行させます。一般的な手口には、npm/pip/go/cargo のインストールコマンドの改ざん、タイポスクワッティングパッケージの注入、シェルコマンドパラメータの書き換えが含まれます。検出方法は、プロキシのレスポンスを直接接続モデルの tool-call ペイロードと比較し、サイレントリライトを発見します。

AC-1.b

条件付きインジェクション

プロキシは prompt の内容に応じて system message を条件付きで注入します — 「銀行」「パスワード」「送金」などの機密用語を含むリクエストには悪意ある指示を、通常のリクエストには沈黙を返します。統計的に異常な分布が現れます。検出は Proxy Monitor がベースラインとテスト対象プロキシ間の system prompt のオフセットを比較します。

AC-2

シークレットスキャニング

プロキシはリクエスト (request) とレスポンス (response) の両端から API キー、アクセストークン、個人情報、企業秘密を静かにスキャンします。コンテンツ自体は**変更されない**ため、一般的な diff ツールでは検出できません。検出は honeypot トークンを注入し、そのトークンがプロキシのログ、Telegram bot、または外部エンドポイントに現れるかを検証します。

よくある質問

AI API中継局検出とは何ですか?+

AI API中継局検出とは、OpenAI互換APIエンドポイントがリクエストを正直に実行しているかを検証する自動テストです。BazaarLink Probeは標準化されたプローブを送信し、モデルすり替え、トークン水増し、システムプロンプト注入、秘密情報窃取など50項目のリスクを検出し、0〜100のスコアを出力します。

中継局がモデルをすり替えているかどうかはどう判断しますか?+

最も信頼できる方法はモデルフィンガープリントです:特定のモデルだけが正確に答えられる質問(知識カットオフ日、特定の能力テストなど)を送信し、期待するモデルの応答と比較します。BazaarLink Probeにはこれらのプローブが内蔵されており、すり替えリスクを自動的にフラグします。

トークン水増しとは何ですか?+

トークン水増し(token padding)とは、中継局がAPIのusageフィールドに実際の消費量より多いトークン数を報告し、過剰請求する手法です。軽度の水増し(5〜15%)は気づきにくいですが、BazaarLink Probeは既知のトークン数と報告値を比較して自動検出します。

APIの遅延はどのくらいが正常ですか?+

TTFT(最初のトークンまでの時間)が500ms以内は正常です;2秒を超えるとパフォーマンス問題がある可能性があります。GPT-4oなどの大型モデルの平均TTFTは300〜800msです。

BazaarLink Probeと通常のpingテストの違いは何ですか?+

Pingはネットワーク接続(ICMPパケット)のみを測定します。BazaarLink Probeはアプリケーション層(L7)の完全なテストで、実際のLLMリクエストを送信してモデルの身元、トークン計算、拒否動作、ストリーム形式、システムプロンプト注入の有無など50項目を検証します。

検出結果をプロバイダー選択にどう活用できますか?+

各プロバイダーのAPIエンドポイントをBazaarLink Probeに入力し、スコアとリスクフラグを比較します。スコアが高い(100に近い)ほど、赤い警告がないほど信頼できるエンドポイントです。モデルの真正性(すり替えなし)、トークン精度(水増しなし)、遅延パフォーマンス(TTFT)の3点に注目してください。

← 回到 BazaarLink 首頁

延伸閱讀

Claude 降智是真的嗎?三種檢測方法,驗出滿血還是摻假
「降智」是中轉站把你買的高階模型換成便宜模型的俗稱。本文說明降智與摻假的差別、為什麼靠感覺判斷不可靠,以及三種可實際操作的檢測方法。
怎麼判斷 AI API 中轉站靠不靠譜?倍率、跑路風險與摻假的判讀
選中轉站不只看價格。本文整理倍率怎麼讀、哪些訊號預示跑路風險、摻假為什麼比全部失敗更危險,以及一份可操作的驗證清單。
Claude Code 接中轉站會降智嗎?反代與隱藏 system prompt 實測
Claude Code 走中轉站變笨,多半不是模型問題,而是反代接口自帶的隱藏 system prompt 在干擾。本文說明反代的來源、為什麼會影響效果,以及怎麼驗。
Token 灌水是什麼?如何檢測 API 是否灌 Token(2026 完整指南)
Token 灌水(token padding)是 AI API 中轉站透過多算 token 數量來謀取利益的手法。本文解釋原理、辨識方式與用 BazaarLink Probe 一鍵檢測的方法。
看全部文章 →各端點檢測紀錄 →

LLM リレー / リバースプロキシ API 品質チェック

任意の OpenAI 互換リレー/リバースプロキシのエンドポイントを入力してください。50 項目の自動テストでモデルすり替え、トークン水増し、システムプロンプト漏洩(AC-1.b)、依存関係ハイジャック(AC-1.a:npm / pip / go / cargo / uv / brew)、シークレット流出(AC-2)、署名改ざん(AC-5)を検出し、0〜100 点でスコアリングします。攻撃分類は arxiv 2604.08407 に基づいています。

中国語推論コード生成モデルすり替え検出トークン水増し検出システムプロンプト漏洩SSE ストリーム検証プロンプト注入テストモデル指紋識別
謝辞 / Acknowledgements
このツールは以下のオープンソースプロジェクトから着想を得ています: LLMmap(MIT、LLM モデル指紋識別)api-relay-audit(MIT、リレーセキュリティ監査)relayAPI(リレーサービス一覧)
テスター協力への感謝
今書
← 回到 BazaarLink 首頁|主流 AI 模型・台幣計費・統一發票
Support
Support
Hi! How can we help you?
Send a message and we'll get back to you soon.