Apa yang terjadi
Jaringan Internasional untuk Pengukuran, Evaluasi, dan Sains AI Lanjutan (sebelumnya Jaringan Internasional Institute Keselamatan AI) menerbitkan dokumen panduan praktik terbaik pertamanya untuk evaluator AI pihak ketiga, yang diselesaikan pada pertemuan Seoul di pinggiran ICML 2026. Dokumen tersebut 'mendetail: pentingnya dan proses mendefinisikan tujuan evaluasi dengan hati-hati dan memilih benchmark yang sesuai; bagaimana memastikan perbandingan antara evaluasi...; bagaimana melakukan iterasi pada elicitasi kemampuan...; dan proses dan isu yang perlu dijalani dalam melakukan evaluasi dan melacak hasil.' Dokumen ini dibangun atas dan melengkapi NIST AI 800-2, menargetkan ekosistem evaluator AI independen yang berkembang di seluruh 10 institusi anggota. Makalah pendamping dari AI Safety Institutes Singapura dan Kanada masing-masing mengatasi pengujian tingkat sistem dan norma berbagi informasi evaluator/pengungkapan selektif.
Mengapa penting
Ini adalah standar metodologi lintas pemerintah yang disepakati pertama untuk evaluasi AI pihak ketiga, yang secara langsung membentuk bagaimana regulator, auditor, dan perusahaan akan melakukan benchmark dan membandingkan penilaian risiko model frontier ke depannya — titik referensi bagi siapa pun papan atau tim kepatuhan yang membangun program jaminan AI.
Tindakan yang diperlukan
Petakan praktik evaluasi dan jaminan AI internal/vendor terhadap rekomendasi praktik terbaik Jaringan, khususnya pada elicitasi kemampuan dan perbandingan.