BazaarLinkBazaarLink
Masuk

BazaarLink Probe untuk relay API AI

Langkah 1 — Konfigurasi Endpoint

Masukkan Base URL, kunci API, dan ID model untuk menjalankan 84 pemeriksaan standar. 2 pemeriksaan opsional membuat total maksimum 86. Laporan memeriksa identitas model, token, prompt injection, rantai pasok, dan streaming.

Gunakan kunci API uji yang dapat dicabutKunci API dikirim ke server BazaarLink Probe hanya untuk pemeriksaan ini dan tidak digunakan kembali sebagai kredensial pemantauan. Gunakan limit rendah dan cabut setelah pengujian.

Relay paling sering diuji

24 jam terakhir
Probe dijalankanRelay unik

BYOK|Letakkan key Anda di balik gerbang peninjauan

Satu konsumen mengajukan pertanyaan yang tidak semestinya, dan yang diblokir adalah API key milik Anda. Setiap permintaan lebih dulu melewati peninjauan konten BazaarLink; pertanyaan berisiko tinggi langsung ditahan dan tidak pernah sampai ke upstream, sehingga secara signifikan mengurangi risiko akun Anda diblokir karena konten yang melanggar.

Pelajari BYOK →

BYOC|GPU milik sendiri, dengan pintu masuk API yang terus melayani

Satu API key; saat konkurensi node penuh, proses mati, atau mesin terputus, permintaan berpindah mulus ke model platform; traffic dari node sendiri tanpa harga, dan hanya traffic yang ditangani fallback yang dikenai biaya.

Baca panduan instalasi lengkap →
RisetarXiv 2604.08407 — Riset Serangan Rantai Pasokan LLMTwitter / X — Diskusi BazaarLinkarXiv 2407.15847 — LLMmap: Sidik Jari Model Bahasa BesararXiv 2604.24827 — IKP: Estimasi Jumlah Parameter LLM Black-Box via Kapasitas FaktualOWASP LLM Top 10 — 10 Risiko Keamanan Teratas untuk Aplikasi LLM

Bagaimana Kami Memutuskan

1Jalankan uji tanyaHingga 86 pertanyaan2Perusahaan manaOpenAI atau Claude?3Model manaMenentukan model persis dalam perusahaan yang sama4Cek ulang model kembarMembedakan model-model yang mirip5Bandingkan dengan klaimHasil uji vs klaim
30
cabang keputusan
8
kemungkinan hasil
0
kali klaim penyedia langsung dipercaya begitu saja
Buka pohon keputusan lengkap untuk melihat bagaimana ketiga hasil ini terbentuk
Pohon KeputusanSemua cabang dari kelima tahap, beserta jalur yang benar-benar dilalui① Jalankan uji tanya1.1Semua terjawab1.2Sedikit terlewat <10%1.3≥10% terlewat, hanya perusahaan≥10% terlewat, han…1.4Endpoint tidak meresponsEndpoint tidak mer…② Perusahaan mana2.1Klaim diri berbahasa Mandarin langsung diterimaKlaim diri berbaha…2.2Sidik jari perilaku yang memutuskanSidik jari perilak…2.3Abstain karena bukti kurangAbstain karena buk…MODPenjaga kontradiksi menurunkan levelPenjaga kontradiks…③ Model mana3.1Gunakan Scoped3.2Dibatalkan oleh pencocokan lintas perusahaanDibatalkan oleh pe…3.3Bukti dari penolakan kosongBukti dari penolak…3.4Diselamatkan oleh pencocokan lintas perusahaanDiselamatkan oleh…3.5Dinaikkan ke Global3.6IKP sebagai benteng terakhirIKP sebagai benten…3.7Abstain, hanya perusahaanAbstain, hanya per…M1Arbitrase V3FM2Veto perusahaan berdasarkan perilakuVeto perusahaan be…④ Cek ulang model kembar4.1Semua lolos → dikonfirmasiSemua lolos → diko…4.2Semua lolos → dibatalkanSemua lolos → diba…4.3Gate tidak lolos4.4Perlindungan H1, tidak pernah dibatalkanPerlindungan H1, t…4.5Baseline sudah usang⑤ Bandingkan dengan klaim5.1Cocok sepenuhnya5.2Hanya perusahaan yang cocokHanya perusahaan y…5.3Model tidak cocok5.4Model ditukar5.5Klaim diri dipalsukan5.6Perilaku diarahkan5.7Data tidak cukup5.8Ambigu
CocokBelum pastiTidak cocokAbu-abu = cabang yang tidak dilalui kali iniKlik node mana pun untuk melihat penjelasannya
Semua pertanyaan terjawab, perusahaan dan model konsisten sesuai sepanjang jalur, pemeriksaan ulang pun mengonfirmasi → cocok sepenuhnya.
Jalur sebenarnya 1.1 → 2.2 → 3.1 → 4.1 → 5.1

Metode dan batasnya

Kami tidak pernah bertanya kepada sebuah endpoint dia model apa — endpoint mana pun bisa menjawab nama apa pun. Kami mengirim 84 pemeriksaan standar agar ia benar-benar bekerja, lalu membandingkan cara kerjanya dengan basis rujukan model-model yang kami kenal. Penilaian berjalan lewat lima tahap, dari kasar ke rinci, dan setiap tahap boleh berkata “buktinya kurang, saya tidak memutuskan”.

Bagaimana kelima tahap menyempit

  1. Menjalankan pemeriksaan

    Apakah endpoint ini bisa diukur sama sekali?

    Prasyarat pertama penilaian adalah pertanyaan benar-benar terjawab. Jawaban yang hilang bukan sekadar data yang lebih sedikit: sisa jawaban bisa kebetulan condong ke arah yang sama, dan itu bias sampel, bukan bukti.

    Bila endpoint sama sekali tidak merespons, atau kunci maupun nama model memang tidak berfungsi, kami berhenti di situ dan tidak merangkai kesimpulan dari serpihan.

  2. Mengenali pembuatnya

    Model ini buatan siapa?

    Penggantian yang paling sering terjadi melintasi keluarga model: model murah memakai nama yang mahal. Perilaku pada tingkat keluarga paling stabil dan paling sulit dipalsukan, jadi lapisan itu kami tanyakan lebih dulu. Yang kami bandingkan adalah gaya dan kebiasaan jawaban, bukan nama yang ia sebut sendiri; pengakuan diri adalah hal yang paling mudah dipalsukan dalam seluruh laporan.

    Tanpa bukti keluarga yang kuat kami abstain, bukan menunjuk asal. Bila endpoint menyebut satu pembuat dalam bahasa Mandarin sementara perilakunya seperti pembuat lain, kami menganggap sebutan itu keseleo lidah dan kembali ke bukti perilaku.

  3. Mengenali modelnya

    Di dalam keluarga itu, model yang mana?

    Anda membeli satu model tertentu, bukan “sesuatu dari pembuat itu”. Yang orang rasakan sebagai penurunan mutu umumnya terjadi di lapisan ini: keluarganya tetap, tempatnya diisi saudara yang lebih murah. Kami menjalankan pembandingan di dalam keluarga dan pembandingan lintas keluarga sekaligus, lalu membiarkan keduanya saling memeriksa — begitu keluarganya salah, pembandingan dalam keluarga akan menyebut model yang keliru dengan sangat percaya diri.

    Bila bukti hanya sampai lapisan keluarga, laporan menyatakannya terang-terangan: kami tahu pembuatnya, bukan modelnya. Kami tidak mengisi kekosongan itu dengan kandidat yang paling mirip.

  4. Menguji ulang si kembar

    Apakah model pilihan tahap sebelumnya benar-benar bisa dibedakan dari saudara terdekatnya?

    Sebagian model adalah kembar: gaya, kemampuan, dan kebiasaan berbahasanya bertumpang tindih begitu banyak sehingga tahap sebelumnya nyaris tidak punya daya beda di antara mereka, dan skornya berdekatan tanpa kedekatan itu berarti apa pun. Tahap ini melakukan satu hal: untuk rumpun kerabat dekat itu, ia mengambil sampel ulang dengan set pertanyaan terpisah yang dibuat khusus untuk pembandingan tersebut, lalu membaca seluruh sebarannya alih-alih satu jawaban. Bila lolos, tahap sebelumnya dikukuhkan atau dibatalkan; bila tidak, hasil tahap sebelumnya tetap berlaku.

    Tahap ini membawa ketaksimetrisan yang disengaja: bila bukti belum menentukan dan hasil tahap sebelumnya kebetulan sama dengan klaim penjual, kami tidak membatalkannya. Menuduh penjual yang jujur lebih mahal ongkosnya daripada melewatkan satu yang tidak jujur.

  5. Mencocokkan dengan klaim

    Di mana letak beda antara hasil ukur dan klaim penjual?

    Proses pengenalannya sendiri tidak melihat apa yang diklaim penjual — tahap-tahap sebelumnya hanya membandingkan bukti perilaku. Klaim itu masuk tepat di dua tempat: ketika tahap keempat memutuskan perlu membatalkan atau tidak, dan di sini. Urutan ini disengaja — mengetahui jawaban sebelum membaca soal membuat klaim tidak bisa menuntun kami. Kesimpulannya: cocok sepenuhnya, hanya keluarga yang cocok, keluarga benar tetapi model berbeda, model diganti, pengakuan diri dipalsukan, perilaku digiring, data tidak cukup, dan tidak konklusif.

    Bila sinyal-sinyalnya saling bertentangan tanpa mayoritas yang stabil, kesimpulannya adalah “tidak konklusif”. Itu kesimpulan resmi, bukan kerusakan sistem.

Mengapa kami sering berkata tidak bisa memastikan

Karena dua arah kesalahan tidak sama ongkosnya. Menyebut relay yang jujur sebagai pengganti model adalah tuduhan, dan itu benar-benar merugikan orang; sebaliknya, satu kasus yang terlewat masih bisa Anda uji ulang atau Anda telusuri lewat riwayatnya. Jadi ketika buktinya tipis, kami memilih tidak memutuskan.

Prinsip itu punya bentuk nyata di dalam kode: laporan hanya menggambar “model tidak cocok” ketika mesin sudah memastikan adanya penggantian. “Model yang paling mirip kebetulan berbeda dari klaim” tidak pernah digambarkan sebagai tuduhan — itu hanya dugaan kami. Ketika Anda melihat “belum dapat dipastikan”, bacaan yang benar adalah bahwa bukti dari pemeriksaan ini tidak cukup untuk memutuskan. Itu bukan surat bersih, bukan pula vonis.

Cara membaca angka dalam laporan

Pemeriksaan aturan dan putusan identitas
Suite standar menjalankan 84 pemeriksaan aturan dan menyusun putusan identitas dari bukti perilaku. Laporan baru tidak memadatkan berbagai pemeriksaan menjadi satu skor gabungan; baca hasil identitas, peringatan aturan, dan buktinya secara terpisah.
Kekuatan putusan
Seberapa kuat bukti pada pemeriksaan ini: seberapa lengkap pertanyaan terjawab, apakah sinyal-sinyalnya menunjuk arah yang sama, dan seberapa lebar jarak antar kandidat yang berkerabat dekat. Nilainya berubah dari satu pemeriksaan ke pemeriksaan berikutnya; ia bukan sifat tetap model itu.
Akurasi historis
Seberapa baik metode ini bekerja pada sampel yang jawabannya sudah kami ketahui. Angka itu dihitung luring dan tidak berhubungan dengan pemeriksaan Anda. Ia tidak boleh dibaca sebagai “peluang putusan ini benar” — kedua angka menjawab pertanyaan yang berbeda dan tidak bisa saling menggantikan.

Yang tidak bisa kami lakukan

Berikut batas kemampuan yang kami ketahui. Kami menuliskannya karena laporan yang menyembunyikan batasnya akan dipercaya melebihi haknya.

  • Kami hanya melihat satu panggilan ini

    Satu pemeriksaan adalah satu sampel. Sebuah relay bisa mengganti model hanya pada sebagian lalu lintas, atau menyajikan barang asli setiap kali polanya terlihat seperti pengujian. Lolos sekali tidak sama dengan jujur dalam jangka panjang — ujilah secara berkala, dan bacalah riwayatnya, bukan satu laporan tunggal.

  • Membedakan model berkerabat dekat ada langit-langitnya

    Ketika peniru sengaja menyalin lebih dari separuh perilaku sasarannya, sekitar separuh bukti secara struktural akan menunjuk identitas yang diklaim. Itu batas struktural, bukan kekurangan jumlah pertanyaan — kami sudah mengukurnya: menambah pertanyaan menaikkan biaya secara tajam sementara daya bedanya nyaris tidak bergerak.

  • Kami tidak bisa membuktikan tidak ada penggantian

    Putusan cocok berarti bahwa bukti pada pemeriksaan ini tidak mendukung adanya penggantian, bukan bahwa penggantian tidak pernah terjadi. Pengujian mana pun yang mengaku menjamin hal kedua sedang membesar-besarkan dirinya.

  • Laporan lama memberi lebih sedikit penanda

    Jalur penilaian direkonstruksi dari data tersimpan setelah kejadian; mesinnya tidak mencatat aturan mana yang ia lalui saat itu. Sebagian cabang tidak meninggalkan jejak yang cukup khas untuk dipulihkan, dan di sana kami hanya menyalakan hasilnya tanpa menandai nomor aturannya. Kami lebih memilih berkata sedikit daripada menebak.

Cakupan pemeriksaan

Cara membaca status

Lulus

Respons memenuhi baseline dan ambang keamanan pemeriksaan ini.

Peringatan

Sinyal belum lengkap atau dekat ambang; periksa penjelasan dan respons mentah.

Gagal

Penyimpangan baseline, kesalahan protokol, atau risiko integritas telah terkonfirmasi.

Cara keputusan dibuat

Identitas model

Membandingkan fingerprint keluarga, ciri submodel, dan sinyal anti-spoofing dengan model yang diklaim.

Pengukuran dan transport

Memeriksa jumlah token, framing SSE, latensi, dan struktur respons untuk mendeteksi penggelembungan.

Keamanan dan rantai pasok

Menguji injeksi System Prompt, kebocoran rahasia, pembajakan dependensi, dan manipulasi tanda tangan.

Attacks this tool detects

Probe ini mendeteksi 3 kelas serangan relay utama dari arXiv 2604.08407: pembajakan dependensi, injeksi System Prompt bersyarat, dan kebocoran kredensial. Probe menampilkan bukti identitas serta peringatan perilaku, tanpa memberikan skor keamanan.

AC-1.a

Manipulasi Respons

The proxy modifies tool-call or text content during response parsing, causing the agent to execute attacker-specified operations. Common tactics include tampering with npm/pip/go/cargo install commands, injecting typosquatting packages, and rewriting shell command parameters. Detection compares the proxy's response to direct-connect tool-call payloads to surface silent rewrites.

AC-1.b

Injeksi Bersyarat

The proxy conditionally injects a system message based on prompt content — malicious instructions for requests containing sensitive terms like "bank", "password", or "transfer", silence for everything else. The skew shows up statistically. Detection uses Proxy Monitor to compare the system-prompt offset between baseline and the relay under test.

AC-2

Pemindaian Rahasia

The proxy silently scans both requests (request) and responses (response) for API keys, access tokens, personal data, and trade secrets. Because the content itself is not modified, generic diff tools miss it. Detection injects a honeypot token and verifies whether it surfaces in proxy logs, Telegram bots, or external endpoints.

Pertanyaan umum

Berapa banyak pemeriksaan yang dijalankan BazaarLink Probe?

Suite berisi 84 pemeriksaan standar dan 2 pemeriksaan opsional, maksimum 86. Pemeriksaan opsional hanya berjalan bila pengaturan dan kemampuan endpoint mendukungnya.

Bagaimana Probe mendeteksi penggantian model?

Probe membandingkan sinyal keluarga, fingerprint submodel, pengetahuan, kemampuan, dan perilaku setelah klaim diri dihapus. Satu sinyal lemah tidak dianggap sebagai bukti.

Apakah BazaarLink menyimpan kunci API saya?

Kunci API hanya digunakan untuk pemeriksaan yang Anda minta dan tidak ditampilkan di laporan atau tautan publik. Gunakan kunci uji yang dapat dicabut dan berlimit rendah.

Apakah peringatan berarti relay melakukan penipuan?

Tidak selalu. Peringatan berarti bukti belum lengkap atau anomali. Tinjau penjelasan dan respons mentah; keputusan mismatch kuat memerlukan beberapa sinyal yang konsisten.

Pemeriksaan Kualitas API Relay / Reverse Proxy LLM

Jalankan 84 pemeriksaan standar dan 2 opsional, maksimum 86, pada relay OpenAI-kompatibel untuk mendeteksi penggantian model, penggelembungan token, injeksi System Prompt, pembajakan dependensi, kebocoran rahasia, dan manipulasi tanda tangan. Tampilkan putusan identitas dan peringatan perilaku. Berdasarkan arXiv 2604.08407.

Penalaran TionghoaPembuatan KodeDeteksi Pergantian ModelDeteksi Inflasi TokenKebocoran System PromptValidasi Stream SSEUji Prompt InjectionSidik Jari Model
Terima kasih
Alat ini terinspirasi oleh proyek open source berikut: LLMmap (MIT, sidik jari model LLM)api-relay-audit (MIT, audit keamanan relay)relayAPI (direktori layanan relay)
Terima kasih kepada para penguji
今書
Kembali ke BazaarLink
Support
Support
Hi! How can we help you?
Send a message and we'll get back to you soon.