Apa yang terjadi
Tim penelitian Off-by-1 Labs 1Password baru menerbitkan (6 Agustus 2026) temuan dari 6.080 patch yang dihasilkan AI di enam CVE terbaru: 53,9% gagal sepenuhnya memperbaiki kerentanan atau memperkenalkan yang baru, sementara hanya 26% yang dengan bersih menyelesaikan cacat tanpa efek samping perilaku. Tim open-sourced tooling FLAWED dan dataset-nya bersama makalah.
Mengapa penting
Memberikan bukti keras bahwa pembuatan patch AI otonom (misalnya Patch the Planet OpenAI, Project Glasswing Anthropic) memerlukan tinjauan ahli manusia sebelum penyebaran produksi, secara langsung menginformasikan bagaimana perusahaan harus gating pipeline perbaikan kerentanan berbasis AI.
Cakupan penerapan
Tim AppSec yang mengadopsi alur kerja patching berbantuan AI harus menggabungkan gating tinjauan manusia dan berkonsultasi dengan benchmark FLAWED sebelum mempercayai pembuatan patch otonom pada skala.