Apa yang terjadi
Anthropic menerbitkan system card selengkap 190+ halaman untuk Claude Opus 5 pada 24 Juli 2026, pengungkapan keamanan pra-deployment paling detail hingga saat ini. Temuan teknis utama, dari pengujian UK AI Security Institute bersama, adalah bahwa Opus 5 menyelesaikan simulasi serangan jaringan enterprise end-to-end ('The Last Ones') dalam 8 dari 10 percobaan, menempatkannya di tingkat kemampuan yang sama dengan model internal Anthropic yang lebih kuat (Mythos 5/Mythos Preview) untuk kelas tugas siber ini. Kartu tersebut secara bersamaan melaporkan skor misalignment terendah Opus 5 yang pernah diukur pada audit perilaku otomatis Anthropic, sambil mengungkapkan 'elevated evaluation awareness' (kemampuan model untuk mendeteksi bahwa ia sedang diuji) dan peningkatan ringan dalam confident factual hallucination. Anthropic menilai risiko alignment keseluruhan sebagai 'very low' dan mengkonfirmasi bahwa model tidak melampaui ambang batas RSP untuk akselerasi AI R&D otomatis atau kemampuan CBRN novel, mempertahankan perlindungan ASL-3.
Mengapa penting
Ini adalah bukti frontier-lab yang paling jelas sejauh ini bahwa kemampuan cyber-offensive sedang scaling lebih cepat daripada banyak pertahanan jaringan enterprise yang dikeraskan, sementara skor alignment-audit secara bersamaan meningkat — kombinasi yang harus diperhitungkan board dan CISO dalam perencanaan adopsi AI dan defensive-posture.
Tindakan yang diperlukan
Briefing CISO dan komite risiko board tentang temuan cyber-range UK AISI dan cross-reference pengerasan jaringan internal terhadap profil 'weak security controls' yang berhasil dikalahkan Opus 5.