BazaarLinkBazaarLink
Anmelden

BazaarLink Probe für KI-API-Relays

Base URL, API-Schlüssel und Modell-ID eingeben und 95 Standardprüfungen ausführen. Mit 2 optionalen Prüfungen sind es höchstens 97. Geprüft werden Modellidentität, Token-Abrechnung, Prompt-Injection, Lieferkettenrisiken und Streaming.

Verlauf
Noch keine Einträge
Schritt 1 — Endpunkt konfigurieren
Widerrufbaren Test-API-Schlüssel verwendenIhr API-Schlüssel wird nur für diese Prüfung an den BazaarLink-Probe-Server gesendet und nicht als Monitoring-Zugang weiterverwendet. Nutzen Sie ein kleines Limit und widerrufen Sie den Schlüssel danach.
Letzte 24 Stunden
Ausgeführte Prüfungen
Eindeutige Relays
0 Std. 23 Std.
Probe-Kostenvoranschlag
Ein vollständiger Lauf umfasst bis zu 97 Prüfungen; die Kosten richten sich nach Modell und Upstream-Preis.
Schnell ~17K Eingabe + ~6K Ausgabe / Voll ~20K + ~11K (inkl. 10× linguistisch)
ModellSchnellVoll
gpt-4$0.870$1.260
claude-opus-4.7$0.235$0.375
claude-opus-4.6$0.235$0.375
claude-sonnet-4.6$0.141$0.225
gpt-5.4$0.133$0.215
gpt-5.2 / 5.3-codex$0.114$0.189
gemini-3.1-pro$0.106$0.172
gpt-4o$0.102$0.160
claude-haiku-4.5$0.047$0.075
gpt-5.4-mini$0.040$0.065
glm-5.1$0.035$0.054
glm-5$0.026$0.040
gpt-3.5-turbo$0.018$0.026
Basierend auf aktuellen Upstream-Preisen, einschließlich linguistischem Fingerabdruck ×10 Wiederholungsaufrufe. Die tatsächlichen Kosten können je nach Antwortlänge leicht variieren.
ForschungarXiv 2604.08407 — LLM Supply Chain AngriffsforschungTwitter / X — BazaarLink DiskussionarXiv 2407.15847 — LLMmap: Fingerprinting für große SprachmodellearXiv 2604.24827 — IKP: Black-Box-LLM-Parameteranzahl über faktische Kapazität schätzenOWASP LLM Top 10 — Top 10 Sicherheitsrisiken für LLM-Anwendungen

Wie wir entscheiden

1Fragen stellenBis zu 97 Fragen2Welcher AnbieterOpenAI oder Claude?3Welches ModellModell innerhalb des Anbieters bestimmen4Zwillings-CheckÄhnliche Modelle unterscheiden5Abgleich mit der AngabeMessung vs. Angabe
30
Entscheidungszweige
8
mögliche Ergebnisse
0
mal wurde die Angabe des Anbieters einfach geglaubt
Den vollständigen Entscheidungsbaum aufklappen und sehen, wie die drei Ergebnisse zustande kommen
EntscheidungsbaumAlle Zweige der fünf Stufen sowie der tatsächlich durchlaufene Pfad① Fragen stellen1.1Alle beantwortet1.2Wenige fehlend <10%1.3≥10% fehlend, nur Anbieter≥10% fehlend, nur…1.4Endpunkt tot② Welcher Anbieter2.1Direkter chinesischer Eigenangabe-TrefferDirekter chinesisc…2.2Verhaltens-Fingerabdruck entscheidetVerhaltens-Fingera…2.3Enthaltung mangels BeweisenEnthaltung mangels…MODWiderspruchs-Schutz stuft herabWiderspruchs-Schut…③ Welches Modell3.1Scoped verwenden3.2Anbieterübergreifend korrigiertAnbieterübergreife…3.3Beleg durch LeerverweigerungBeleg durch Leerve…3.4Anbieterübergreifende RettungAnbieterübergreife…3.5Zu Global hochgestuft3.6IKP als letzte VerteidigungslinieIKP als letzte Ver…3.7Enthaltung, nur AnbieterEnthaltung, nur An…M1V3F-SchlichtungM2Verhaltensbasiertes Anbieter-VetoVerhaltensbasierte…④ Zwillings-Check4.1Alles bestanden → bestätigtAlles bestanden →…4.2Alles bestanden → umgestoßenAlles bestanden →…4.3Gate nicht bestanden4.4H1-Schutz, wird nicht umgestoßenH1-Schutz, wird ni…4.5Baseline veraltet⑤ Abgleich mit der Angabe5.1Vollständige ÜbereinstimmungVollständige Übere…5.2Nur Anbieter stimmt übereinNur Anbieter stimm…5.3Modell stimmt nicht übereinModell stimmt nich…5.4Modelltausch5.5Eigenangabe gefälscht5.6Verhalten wurde gelenktVerhalten wurde ge…5.7Nicht genug Daten5.8Uneindeutig
ÜbereinstimmungUnbestimmtAbweichungGrau = diesmal nicht durchlaufener ZweigAuf einen beliebigen Knoten klicken, um die Erklärung zu sehen
Alle Fragen wurden beantwortet, Anbieter und Modell stimmen durchgehend überein, die Nachprüfung bestätigt es → vollständige Übereinstimmung.
Tatsächlicher Pfad 1.1 → 2.2 → 3.1 → 4.1 → 5.1

Prüfumfang

Status richtig lesen

Bestanden

Die Antwort erfüllt Referenzwert und Sicherheitsschwelle dieser Prüfung.

Warnung

Das Signal ist unvollständig oder nahe am Grenzwert; Erklärung und Rohantwort prüfen.

Fehlgeschlagen

Eine Abweichung, ein Protokollfehler oder Integritätsrisiko wurde bestätigt.

So entsteht das Urteil

Modellidentität

Familien-Fingerprints, Submodell-Merkmale und Anti-Spoofing-Signale werden mit der Modellangabe abgeglichen.

Abrechnung und Transport

Token-Zahlen, SSE-Struktur, Latenz und Antwortformat werden auf Aufblähung und Relay-Fehler geprüft.

Sicherheit und Lieferkette

Prüft System-Prompt-Injection, Geheimnisabfluss, Dependency-Hijacking und Signaturmanipulation.

Attacks this tool detects

This probe implements detection for 3 key relay-attack classes from arXiv 2604.08407 — supply-chain injection, conditional system-prompt injection, and credential exfiltration. Each test run executes 50+ probes against your endpoint to surface these attack surfaces.

AC-1.a

Antwort-Manipulation

The proxy modifies tool-call or text content during response parsing, causing the agent to execute attacker-specified operations. Common tactics include tampering with npm/pip/go/cargo install commands, injecting typosquatting packages, and rewriting shell command parameters. Detection compares the proxy's response to direct-connect tool-call payloads to surface silent rewrites.

AC-1.b

Bedingte Injektion

The proxy conditionally injects a system message based on prompt content — malicious instructions for requests containing sensitive terms like "bank", "password", or "transfer", silence for everything else. The skew shows up statistically. Detection uses Proxy Monitor to compare the system-prompt offset between baseline and the relay under test.

AC-2

Geheimnis-Scanning

The proxy silently scans both requests (request) and responses (response) for API keys, access tokens, personal data, and trade secrets. Because the content itself is **not modified**, generic diff tools miss it. Detection injects a honeypot token and verifies whether it surfaces in proxy logs, Telegram bots, or external endpoints.

Häufige Fragen

Wie viele Prüfungen führt BazaarLink Probe aus?

Die Suite umfasst 95 Standardprüfungen und 2 optionale Prüfungen, insgesamt höchstens 97. Optionale Prüfungen laufen nur bei passender Einstellung und Endpoint-Fähigkeit.

Wie erkennt Probe einen Modellaustausch?

Probe vergleicht Modellfamilie, Submodell-Fingerprints, Wissens- und Fähigkeitsmerkmale sowie das Verhalten ohne Eigenangaben. Ein einzelnes schwaches Signal gilt nicht als Beweis.

Speichert BazaarLink meinen API-Schlüssel?

Der API-Schlüssel wird nur für die angeforderte Prüfung verwendet und erscheint weder im Bericht noch im öffentlichen Link. Verwenden Sie einen widerrufbaren Testschlüssel mit kleinem Limit.

Bedeutet eine Warnung, dass das Relay betrügt?

Nein. Eine Warnung kennzeichnet unvollständige oder auffällige Evidenz. Prüfen Sie Erklärung und Rohantwort; ein starkes Fehlurteil verlangt mehrere übereinstimmende Signale.

LLM Relay / Reverse-Proxy API Qualitätsprüfung

Prüfen Sie OpenAI-kompatible Relays mit 95 Standard- und 2 optionalen Prüfungen, höchstens 97, auf Modellaustausch, Token-Aufblähung, System-Prompt-Injection, Dependency-Hijacking, Geheimnisabfluss und Signaturmanipulation. Ergebnis: 0–100 Punkte. Grundlage: arXiv 2604.08407 Angriffstaxonomie.

Chinesisches ReasoningCode-GenerierungModellwechsel-ErkennungToken-Inflation-ErkennungSystem-Prompt-LeakSSE-Stream-PrüfungPrompt-Injection-TestModell-Fingerprinting
Danksagungen
Dieses Tool ist inspiriert von folgenden Open-Source-Projekten: LLMmap (MIT, LLM-Modell-Fingerprinting)api-relay-audit (MIT, Relay-Sicherheitsaudit)relayAPI (Relay-Verzeichnis)
Danke an unsere Tester
今書
Zurück zu BazaarLink
Support
Support
Hi! How can we help you?
Send a message and we'll get back to you soon.
BazaarLink Probe | Integrität von KI-API-Relays prüfen | BazaarLink