Kami tidak pernah bertanya kepada sebuah endpoint dia model apa — endpoint mana pun bisa menjawab nama apa pun. Kami mengirim 84 pemeriksaan standar agar ia benar-benar bekerja, lalu membandingkan cara kerjanya dengan basis rujukan model-model yang kami kenal. Penilaian berjalan lewat lima tahap, dari kasar ke rinci, dan setiap tahap boleh berkata “buktinya kurang, saya tidak memutuskan”.
①Menjalankan pemeriksaan
Apakah endpoint ini bisa diukur sama sekali?
Prasyarat pertama penilaian adalah pertanyaan benar-benar terjawab. Jawaban yang hilang bukan sekadar data yang lebih sedikit: sisa jawaban bisa kebetulan condong ke arah yang sama, dan itu bias sampel, bukan bukti.
Bila endpoint sama sekali tidak merespons, atau kunci maupun nama model memang tidak berfungsi, kami berhenti di situ dan tidak merangkai kesimpulan dari serpihan.
②Mengenali pembuatnya
Model ini buatan siapa?
Penggantian yang paling sering terjadi melintasi keluarga model: model murah memakai nama yang mahal. Perilaku pada tingkat keluarga paling stabil dan paling sulit dipalsukan, jadi lapisan itu kami tanyakan lebih dulu. Yang kami bandingkan adalah gaya dan kebiasaan jawaban, bukan nama yang ia sebut sendiri; pengakuan diri adalah hal yang paling mudah dipalsukan dalam seluruh laporan.
Tanpa bukti keluarga yang kuat kami abstain, bukan menunjuk asal. Bila endpoint menyebut satu pembuat dalam bahasa Mandarin sementara perilakunya seperti pembuat lain, kami menganggap sebutan itu keseleo lidah dan kembali ke bukti perilaku.
③Mengenali modelnya
Di dalam keluarga itu, model yang mana?
Anda membeli satu model tertentu, bukan “sesuatu dari pembuat itu”. Yang orang rasakan sebagai penurunan mutu umumnya terjadi di lapisan ini: keluarganya tetap, tempatnya diisi saudara yang lebih murah. Kami menjalankan pembandingan di dalam keluarga dan pembandingan lintas keluarga sekaligus, lalu membiarkan keduanya saling memeriksa — begitu keluarganya salah, pembandingan dalam keluarga akan menyebut model yang keliru dengan sangat percaya diri.
Bila bukti hanya sampai lapisan keluarga, laporan menyatakannya terang-terangan: kami tahu pembuatnya, bukan modelnya. Kami tidak mengisi kekosongan itu dengan kandidat yang paling mirip.
④Menguji ulang si kembar
Apakah model pilihan tahap sebelumnya benar-benar bisa dibedakan dari saudara terdekatnya?
Sebagian model adalah kembar: gaya, kemampuan, dan kebiasaan berbahasanya bertumpang tindih begitu banyak sehingga tahap sebelumnya nyaris tidak punya daya beda di antara mereka, dan skornya berdekatan tanpa kedekatan itu berarti apa pun. Tahap ini melakukan satu hal: untuk rumpun kerabat dekat itu, ia mengambil sampel ulang dengan set pertanyaan terpisah yang dibuat khusus untuk pembandingan tersebut, lalu membaca seluruh sebarannya alih-alih satu jawaban. Bila lolos, tahap sebelumnya dikukuhkan atau dibatalkan; bila tidak, hasil tahap sebelumnya tetap berlaku.
Tahap ini membawa ketaksimetrisan yang disengaja: bila bukti belum menentukan dan hasil tahap sebelumnya kebetulan sama dengan klaim penjual, kami tidak membatalkannya. Menuduh penjual yang jujur lebih mahal ongkosnya daripada melewatkan satu yang tidak jujur.
⑤Mencocokkan dengan klaim
Di mana letak beda antara hasil ukur dan klaim penjual?
Proses pengenalannya sendiri tidak melihat apa yang diklaim penjual — tahap-tahap sebelumnya hanya membandingkan bukti perilaku. Klaim itu masuk tepat di dua tempat: ketika tahap keempat memutuskan perlu membatalkan atau tidak, dan di sini. Urutan ini disengaja — mengetahui jawaban sebelum membaca soal membuat klaim tidak bisa menuntun kami. Kesimpulannya: cocok sepenuhnya, hanya keluarga yang cocok, keluarga benar tetapi model berbeda, model diganti, pengakuan diri dipalsukan, perilaku digiring, data tidak cukup, dan tidak konklusif.
Bila sinyal-sinyalnya saling bertentangan tanpa mayoritas yang stabil, kesimpulannya adalah “tidak konklusif”. Itu kesimpulan resmi, bukan kerusakan sistem.
Karena dua arah kesalahan tidak sama ongkosnya. Menyebut relay yang jujur sebagai pengganti model adalah tuduhan, dan itu benar-benar merugikan orang; sebaliknya, satu kasus yang terlewat masih bisa Anda uji ulang atau Anda telusuri lewat riwayatnya. Jadi ketika buktinya tipis, kami memilih tidak memutuskan.
Prinsip itu punya bentuk nyata di dalam kode: laporan hanya menggambar “model tidak cocok” ketika mesin sudah memastikan adanya penggantian. “Model yang paling mirip kebetulan berbeda dari klaim” tidak pernah digambarkan sebagai tuduhan — itu hanya dugaan kami. Ketika Anda melihat “belum dapat dipastikan”, bacaan yang benar adalah bahwa bukti dari pemeriksaan ini tidak cukup untuk memutuskan. Itu bukan surat bersih, bukan pula vonis.
- Pemeriksaan aturan dan putusan identitas
- Suite standar menjalankan 84 pemeriksaan aturan dan menyusun putusan identitas dari bukti perilaku. Laporan baru tidak memadatkan berbagai pemeriksaan menjadi satu skor gabungan; baca hasil identitas, peringatan aturan, dan buktinya secara terpisah.
- Kekuatan putusan
- Seberapa kuat bukti pada pemeriksaan ini: seberapa lengkap pertanyaan terjawab, apakah sinyal-sinyalnya menunjuk arah yang sama, dan seberapa lebar jarak antar kandidat yang berkerabat dekat. Nilainya berubah dari satu pemeriksaan ke pemeriksaan berikutnya; ia bukan sifat tetap model itu.
- Akurasi historis
- Seberapa baik metode ini bekerja pada sampel yang jawabannya sudah kami ketahui. Angka itu dihitung luring dan tidak berhubungan dengan pemeriksaan Anda. Ia tidak boleh dibaca sebagai “peluang putusan ini benar” — kedua angka menjawab pertanyaan yang berbeda dan tidak bisa saling menggantikan.
Berikut batas kemampuan yang kami ketahui. Kami menuliskannya karena laporan yang menyembunyikan batasnya akan dipercaya melebihi haknya.
- Kami hanya melihat satu panggilan ini
Satu pemeriksaan adalah satu sampel. Sebuah relay bisa mengganti model hanya pada sebagian lalu lintas, atau menyajikan barang asli setiap kali polanya terlihat seperti pengujian. Lolos sekali tidak sama dengan jujur dalam jangka panjang — ujilah secara berkala, dan bacalah riwayatnya, bukan satu laporan tunggal.
- Membedakan model berkerabat dekat ada langit-langitnya
Ketika peniru sengaja menyalin lebih dari separuh perilaku sasarannya, sekitar separuh bukti secara struktural akan menunjuk identitas yang diklaim. Itu batas struktural, bukan kekurangan jumlah pertanyaan — kami sudah mengukurnya: menambah pertanyaan menaikkan biaya secara tajam sementara daya bedanya nyaris tidak bergerak.
- Kami tidak bisa membuktikan tidak ada penggantian
Putusan cocok berarti bahwa bukti pada pemeriksaan ini tidak mendukung adanya penggantian, bukan bahwa penggantian tidak pernah terjadi. Pengujian mana pun yang mengaku menjamin hal kedua sedang membesar-besarkan dirinya.
- Laporan lama memberi lebih sedikit penanda
Jalur penilaian direkonstruksi dari data tersimpan setelah kejadian; mesinnya tidak mencatat aturan mana yang ia lalui saat itu. Sebagian cabang tidak meninggalkan jejak yang cukup khas untuk dipulihkan, dan di sana kami hanya menyalakan hasilnya tanpa menandai nomor aturannya. Kami lebih memilih berkata sedikit daripada menebak.