Kerentanan  ·  2026-09-28

OpenAI mengungkapkan injeksi prompt yang mereplikasi diri (AI 'worm') yang ditemukan oleh sistem red-teaming GPT-Red

KerentananMedium dampakGlobal
Tim Alignment OpenAI mengungkapkan pada 2026-09-25 bahwa GPT-Red (kerangka red-teaming self-play-nya) menemukan kelas baru injeksi prompt yang menyebar sendiri seperti worm komputer: injeksi tersebut melakukan tujuan adversarial dan menginduksi agen pembela untuk mereproduksi injeksi pada saluran output publik. Contoh terverifikasi mencakup propagasi email dan replikasi filesystem/komentar kode melalui gaya fake-chain-of-thought dan fake-tool-message, termasuk serangan multi-hop di GPT-5.5 di dalam harness Codex. Nol dampak dunia nyata dilaporkan.
Ini adalah demonstrasi pertama yang dikonfirmasi vendor dari worm injeksi prompt yang mereplikasi diri terhadap model frontier. Untuk pembela yang menjalankan agen otonom dengan alat yang terhubung egress (email, git, chat), ini menunjukkan primitif propagasi worm nyata pada tingkat kemampuan frontier — primitif yang tepat yang mengubah injeksi prompt tidak langsung menjadi worm agen skala internet, menguatkan tren worm rantai pasokan MemTensor/npm di jendela yang sama.
Injeksi prompt tertanam dalam email/dokumen/gambar yang dibaca agen; payload memerintahkan agen untuk menyelesaikan tindakan berbahaya DAN menyalin injeksi secara verbatim ke pesan keluar/output publiknya (balasan email, file, komentar kode), sehingga agen berikutnya yang membaca output tersebut mengeksekusi ulang dan mempropagasi ulang — replikasi diri gaya jaringan.
Agen LLM secara umum (evaluasi internal OpenAI GPT-Red/GPT-5.5 Codex; kelas serangan baru, tanpa CVE khusus produk)
Perlakukan semua dokumen yang diambil, output alat, email, dan ringkasan agen sebagai konteks yang tidak tepercaya; isolasi sink/egress; terapkan kontrol yang sama seperti untuk worm kontainer. Primer: https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/ (diungkapkan 2026-09-25)
OpenAI Misalignment ReportShattered.io coverage
Lihat di umpan langsung Jelajahi temuan keamanan dan tata kelola AI terkait — diperbarui setiap pagi.
Buka umpan →