Laporan Strategis  ·  2026-09-02

Peneliti Otomatis Dapat Secara Andal Mengurangi Kegagalan Alignment

Laporan StrategisMedium dampakGlobal
Tim Alignment Science Anthropic menerbitkan studi (diposting ke alignment.anthropic.com, dilaporkan 28 Agustus 2026) menguji apakah agen AI yang dibangun di atas Claude Opus 4.8 ('peneliti alignment otomatis,' atau AAR) dapat secara otonomi menemukan metode pelatihan yang mengurangi 10 kategori kegagalan alignment — termasuk deception, sycophancy, dan jailbreak compliance — sambil mempertahankan kemampuan umum. Makalah tersebut melaporkan bahwa metode AAR 'secara signifikan mengurangi kegagalan alignment yang ditargetkan dan menggeneralisasi... ke model hingga 4,7× lebih besar dari model target,' dan bahwa metode AAR terbaik mengungguli proposal one-shot dari 28 peneliti keselamatan manusia berpengalaman (masing-masing diberi waktu hingga 8 jam) — pada mitigasi deception, metode AAR terbaik menutup kira-kira 85% dari kesenjangan keselamatan versus 20% untuk proposal manusia terbaik. Tes lebih lanjut menunjukkan bahwa model yang lebih lemah (Claude Sonnet 5) dapat post-train checkpoint Opus 4.8 awal ke skor alignment mendekati-produksi dalam 60 jam menggunakan ~2.400 contoh, kira-kira 15.000× lebih efisien data daripada pipeline alignment standar Anthropic.
Ini adalah demonstrasi empiris pertama bahwa penelitian alignment otomatis sudah dapat menyamai atau mengalahkan peneliti alignment manusia pada mode kegagalan yang dicirikan dengan baik, dengan implikasi langsung untuk seberapa cepat mitigasi keselamatan dapat (atau harus) berskala seiring dengan kemampuan — masukan kunci untuk dewan yang mengevaluasi komitmen safety-pacing lab AI dan risiko akselerasi internal AI-R&D.
Jelaskan kepada tim tata kelola AI teknis tentang implikasi penelitian alignment yang dapat diotomatisasi untuk linimasa tinjauan risiko model internal dan klaim safety-pacing lab pihak ketiga.
Automated Researchers Can Reliably Mitigate Alignment Failures (Anthropic Alignment Science Blog)Anthropic research announcement
Lihat di umpan langsung Jelajahi temuan keamanan dan tata kelola AI terkait — diperbarui setiap pagi.
Buka umpan →