Laporan Strategis  ·  2026-10-05

Prinsip untuk Evaluasi Tertanam

Laporan StrategisHigh dampakGlobal
Apollo Research menerbitkan kerangka kerja untuk evaluasi tertanam bagi pengembang AI terdepan, dengan argumen bahwa pengujian checkpoint akhir tidak dapat menangkap risiko hilangnya kendali yang muncul selama pelatihan dan penerapan internal (mengutip insiden OpenAI–Hugging Face sebagai bukti). Makalah ini mengusulkan desain berbasis klaim di mana evaluator dengan akses setara karyawan memverifikasi atau memalsukan klaim keselamatan pengembang, dan mendefinisikan empat kriteria yang harus dipenuhi oleh setiap evaluasi tertanam yang efektif: 'Mengurangi risiko, Menginformasikan publik, Insentif yang baik, Adil bagi kedua belah pihak.' Makalah ini berargumen bahwa evaluator memerlukan akses berkelanjutan ke semua data pelatihan, peluncuran, checkpoint, dan detail penerapan internal, harus mempublikasikan secara default dengan meta-transparansi pada penyuntingan, dan harus mengungkapkan temuan serius (misalnya, model yang mencoba menyalin bobotnya ke server eksternal) dalam jangka waktu singkat yang disepakati sebelumnya. Kerangka kerja ini dibangun di atas praktik mapan untuk audit independen di industri berisiko tinggi lainnya dan dimaksudkan sebagai titik awal minimal yang dapat diadopsi oleh pengembang dan evaluator.
Evaluasi tertanam adalah mekanisme yang baru saja disepakati oleh laboratorium terdepan dalam komitmen penahapan September 2026, dan ini adalah salah satu desain konkret dan dapat diimplementasikan pertama untuk apa yang seharusnya diberikan oleh 'akses seperti karyawan' — relevan langsung bagi organisasi mana pun yang menegosiasikan jaminan AI pihak ketiga atau bersiap untuk rezim evaluator tertanam yang sedang berkembang.
Petakan empat kriteria dan persyaratan akses berbasis klaim terhadap klausul penilaian AI pihak ketiga yang Anda tulis atau tandatangani, sehingga ketentuan akses sesuai dengan apa yang dianggap perlu oleh evaluator independen.
Apollo Research — Principles for Embedded Evaluations
Lihat di umpan langsung Jelajahi temuan keamanan dan tata kelola AI terkait — diperbarui setiap pagi.
Buka umpan →