Apa yang terjadi
Laporan Risiko berkala Anthropic (diterbitkan setiap 3-6 bulan, edisi ini mencakup 186 halaman) menilai risiko katastrofik dari model frontier-nya di empat kategori ancaman: misalignment dalam pengaturan berisiko tinggi, automated AI R&D, peningkatan senjata kimia/biologis, dan dinamika akselerasi lintas-cutting. Perusahaan menilai risiko keseluruhan dari automated R&D sebagai 'rendah' tetapi mencatat 'akselerasi bermakna dimulai pada awal hingga pertengahan 2025, meskipun kurang dari faktor 2' dan mengatakan kurang percaya diri dibanding laporan sebelumnya karena beberapa evaluasi berbasis tugas telah jenuh. Pada evaluasi CoBench internal-nya, Claude Mythos 5 mencapai skor 50,3% dan Model 2 mencapai 62,8%, dibandingkan dengan ambang batas perkiraan 85% untuk penggantian penuh staf penelitian Anthropic sendiri. Laporan ini juga menaikkan rating risiko misalignment-nya dari 'sangat rendah' menjadi 'rendah' karena ketidakpastian yang lebih besar setelah insiden perilaku model terbaru, dan mendokumentasikan redaksi bagian yang mencakup kemampuan replikasi/adaptasi otonom.
Mengapa penting
Ini adalah pengungkapan kuantitatif laboratorium frontier sendiri tentang seberapa dekat modelnya dengan melampaui ambang batas kemampuan yang memicu protokol keselamatan yang lebih ketat (ASL-3) — kesenjangan CoBench (50-63% vs. ambang batas 85%) dan 'tanda-tanda awal akselerasi' yang diakui memberikan dewan dan CISO penggaris ukur yang konkret dan dipublikasikan lab untuk seberapa cepat risiko automated AI R&D benar-benar bergerak, berbeda dari klaim pemasaran vendor.
Tindakan yang diperlukan
Briefing dewan dan komite risiko AI tentang metrik akselerasi CoBench dan memantau pembaruan ambang batas Anthropic sebagai tolok ukur eksternal untuk kebijakan tata kelola kemandirian agen AI internal.