Chúng tôi không hỏi một endpoint xem nó là mô hình nào — endpoint nào cũng có thể trả lời bất kỳ cái tên nào. Chúng tôi gửi 84 phép kiểm tiêu chuẩn để bắt nó làm việc thật, rồi so cách nó làm việc với mốc chuẩn của những mô hình chúng tôi đã biết. Việc phán định đi qua năm chặng, từ thô đến tinh, và chặng nào cũng được phép nói rằng bằng chứng chưa đủ nên chưa kết luận.
①Ra đề và đo thật
Endpoint này có đo được hay không đã?
Điều kiện đầu tiên của phán định là các câu hỏi thật sự có lời đáp. Câu thiếu lời đáp không chỉ là ít dữ liệu hơn: những câu trả về có thể tình cờ nghiêng hết về một phía, và đó là lệch mẫu chứ không phải bằng chứng.
Nếu endpoint không phản hồi gì, hoặc khóa và tên mô hình vốn đã không dùng được, chúng tôi dừng ngay tại đó thay vì chắp vá một kết luận từ phần còn sót.
②Nhận ra do ai làm ra
Đây là mô hình do ai làm ra?
Kiểu tráo phổ biến nhất là tráo xuyên họ: một mô hình rẻ khoác cái tên đắt. Hành vi ở tầng họ mô hình ổn định nhất và khó giả nhất, nên chúng tôi hỏi tầng đó trước. Thứ chúng tôi đối chiếu là văn phong và thói quen trả lời, không phải cái tên nó tự xưng; lời tự xưng là thứ dễ làm giả nhất trong cả bản báo cáo.
Không đủ bằng chứng ở tầng họ thì chúng tôi bỏ phiếu trắng chứ không gọi tên cho có. Khi một endpoint tự xưng một nơi sản xuất bằng tiếng Trung nhưng hành xử như một nơi khác, chúng tôi coi lời tự xưng đó là lỡ lời và quay về với bằng chứng hành vi.
③Nhận ra là bản nào
Trong cùng một họ, đây là bản nào?
Thứ bạn mua là một bản cụ thể, không phải một mô hình nào đó của nơi ấy. Cái mà người ta gọi là bị giảm chất lượng phần lớn xảy ra ở tầng này: họ mô hình vẫn nguyên, chỗ của nó bị thay bằng một bản anh em rẻ hơn. Chúng tôi chạy đối chiếu trong họ và đối chiếu xuyên họ cùng lúc rồi để hai kết quả kiểm tra lẫn nhau — một khi họ mô hình đã sai, đối chiếu trong họ sẽ gọi tên sai với một sự tự tin rất cao.
Khi bằng chứng chỉ đủ tới tầng họ, báo cáo nói thẳng rằng chúng tôi biết là do ai làm ra chứ không biết là bản nào, thay vì điền vào chỗ trống ứng viên trông giống nhất.
④Phúc tra cặp sinh đôi
Bản mà chặng trước chọn ra có thật sự tách được khỏi những anh em gần nhất của nó không?
Có những bản là sinh đôi: văn phong, năng lực và lối nói quen thuộc trùng nhau tới mức chặng trước gần như không còn khả năng phân biệt giữa chúng, điểm số xích lại gần nhau mà sự gần đó chẳng có ý nghĩa gì. Chặng này chỉ làm một việc: với những cụm họ hàng gần như thế, nó lấy mẫu lại bằng một bộ câu hỏi riêng được dựng đúng cho phép so sánh đó, rồi đọc toàn bộ phân bố thay vì đọc từng câu trả lời. Qua được thì chặng trước hoặc được xác nhận hoặc bị lật; không qua thì kết quả chặng trước giữ nguyên.
Chặng này mang một sự bất đối xứng có chủ ý: khi bằng chứng chưa có tính quyết định mà kết quả chặng trước lại tình cờ trùng với điều nhà cung cấp công bố, chúng tôi không lật. Vu oan cho một nhà cung cấp trung thực đắt hơn là bỏ lọt một nhà cung cấp gian dối.
⑤Đối chiếu với công bố
Kết quả đo khác với công bố của nhà cung cấp ở chỗ nào?
Bản thân việc nhận diện không nhìn vào điều nhà cung cấp công bố — các chặng trước chỉ đối chiếu bằng chứng hành vi. Lời công bố chỉ bước vào ở đúng hai chỗ: khi chặng thứ tư quyết định có lật hay không, và ở đây. Thứ tự này là cố ý — có đáp án trước khi đọc đề thì lời công bố không dắt mũi được. Các kết luận gồm: khớp hoàn toàn, chỉ khớp họ mô hình, đúng họ nhưng sai bản, bị tráo mô hình, lời tự xưng bị làm giả, hành vi bị dẫn dắt, dữ liệu không đủ, và không ngã ngũ.
Khi các tín hiệu mâu thuẫn nhau mà không có đa số ổn định, kết luận là không ngã ngũ. Đó là một kết luận chính thức, không phải hệ thống hỏng.
Vì hai chiều sai lầm không có cái giá như nhau. Nói một relay trung thực là kẻ tráo mô hình là một lời buộc tội, và nó gây thiệt hại thật cho người thật; ngược lại, bỏ lọt một lần thì bạn vẫn có thể đo lại hoặc xem lịch sử của nó. Vì vậy khi bằng chứng mỏng, chúng tôi chọn không kết luận.
Nguyên tắc ấy có hình hài cụ thể trong mã nguồn: báo cáo chỉ vẽ ra dấu hiệu mô hình không khớp khi engine đã xác nhận có sự thay thế. Còn việc mô hình giống nhất tình cờ khác với công bố thì không bao giờ được vẽ thành lời buộc tội — đó chỉ là phỏng đoán của chúng tôi. Khi bạn thấy dòng chữ chưa xác định, cách đọc đúng là bằng chứng của lần chạy này chưa đủ để kết luận. Nó không phải giấy chứng nhận trong sạch, cũng không phải bản án.
- Kiểm tra theo quy tắc và phán định danh tính
- Bộ tiêu chuẩn chạy 84 phép kiểm theo quy tắc và tạo phán định danh tính từ bằng chứng hành vi. Báo cáo mới không nén các loại kiểm tra khác nhau thành một điểm tổng hợp; hãy đọc riêng kết quả danh tính, cảnh báo quy tắc và bằng chứng.
- Độ mạnh của phán định
- Là độ mạnh của bằng chứng trong lần chạy này: các câu hỏi được trả lời đầy đủ tới đâu, các tín hiệu có cùng chỉ về một hướng không, và khoảng cách giữa những ứng viên họ hàng gần có đủ rộng không. Giá trị này thay đổi theo từng lần đo, không phải thuộc tính cố định của mô hình.
- Độ chính xác lịch sử
- Là mức làm đúng của phương pháp này trên những mẫu mà chúng tôi đã biết đáp án. Nó được tính ngoại tuyến và không liên quan gì tới lần đo của bạn. Không được đọc nó thành xác suất phán định lần này là đúng — hai con số trả lời hai câu hỏi khác nhau và không thể thay thế cho nhau.
Dưới đây là các giới hạn mà chúng tôi biết. Chúng tôi viết ra vì một bản báo cáo giấu đi giới hạn của mình sẽ được tin tưởng nhiều hơn mức nó xứng đáng.