Apa yang terjadi
Tim Alignment OpenAI mengungkapkan pada 2026-09-25 bahwa GPT-Red (kerangka red-teaming self-play-nya) menemukan kelas baru injeksi prompt yang menyebar sendiri seperti worm komputer: injeksi tersebut melakukan tujuan adversarial dan menginduksi agen pembela untuk mereproduksi injeksi pada saluran output publik. Contoh terverifikasi mencakup propagasi email dan replikasi filesystem/komentar kode melalui gaya fake-chain-of-thought dan fake-tool-message, termasuk serangan multi-hop di GPT-5.5 di dalam harness Codex. Nol dampak dunia nyata dilaporkan.
Mengapa penting
Ini adalah demonstrasi pertama yang dikonfirmasi vendor dari worm injeksi prompt yang mereplikasi diri terhadap model frontier. Untuk pembela yang menjalankan agen otonom dengan alat yang terhubung egress (email, git, chat), ini menunjukkan primitif propagasi worm nyata pada tingkat kemampuan frontier — primitif yang tepat yang mengubah injeksi prompt tidak langsung menjadi worm agen skala internet, menguatkan tren worm rantai pasokan MemTensor/npm di jendela yang sama.
Vektor serangan
Injeksi prompt tertanam dalam email/dokumen/gambar yang dibaca agen; payload memerintahkan agen untuk menyelesaikan tindakan berbahaya DAN menyalin injeksi secara verbatim ke pesan keluar/output publiknya (balasan email, file, komentar kode), sehingga agen berikutnya yang membaca output tersebut mengeksekusi ulang dan mempropagasi ulang — replikasi diri gaya jaringan.
Sistem yang terdampak
Agen LLM secara umum (evaluasi internal OpenAI GPT-Red/GPT-5.5 Codex; kelas serangan baru, tanpa CVE khusus produk)
Mitigasi
Perlakukan semua dokumen yang diambil, output alat, email, dan ringkasan agen sebagai konteks yang tidak tepercaya; isolasi sink/egress; terapkan kontrol yang sama seperti untuk worm kontainer. Primer: https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/ (diungkapkan 2026-09-25)