Kerentanan  ·  2026-09-30

Virus AI Berbagi-Borne: injeksi prompt memory-hopping yang dimediasi artefak menyebarkan payload yang mereplikasi diri di seluruh agen LLM (arXiv)

KerentananHigh dampakGlobal
arXiv 2609.35576 (diajukan 2026-09-28, dalam jendela) memformalkan 'propagasi yang dimediasi artefak' dari status injeksi prompt di seluruh agen LLM yang dioperasikan secara independen dari waktu ke waktu. Dalam simulasi agen-manusia temporal, serangan bertahan melalui serah terima berturut-turut dan bertahan; pada GPT-5.6 Luna di lingkungan yang lebih besar payload mencapai 60–80% agen dengan rantai propagasi hingga delapan hop. Diposisikan bersama pengungkapan injeksi replikasi mandiri OpenAI baru-baru ini sebagai kelas serangan yang mereplikasi diri baru yang dibawa oleh saluran memori/artefak agen.
Menunjukkan bahwa memori persisten agen dan artefak bersama yang dibaca/ditulisnya (laporan, dokumen, file) dapat bertindak sebagai status 'pembawa' yang tahan lama untuk worm injeksi prompt yang melompat di antara asisten yang sebaliknya independen dan bertahan lebih lama dari interaksi individu. Bagi para pembela, ini berarti penyimpanan artefak, drive bersama, dan backend memori agen adalah vektor propagasi kelas satu: pemindaian memori, sandboxing konten yang ditulis agen, dan memperlakukan semua konten yang dipersistenkan/diringkas sebagai tidak tepercaya adalah kontrol yang diperlukan.
Konten adversial yang diperkenalkan melalui artefak bersama (mis. laporan) disimpan dalam memori persisten asisten, direproduksi dalam artefak yang dibuat selanjutnya, dan diperoleh oleh asisten lain yang kemudian membacanya — propagasi melalui pertukaran artefak (memory-hopping), tanpa komunikasi langsung agen-ke-agen.
Asisten LLM stateful dengan memori persisten dan akses alat ke artefak bersama (dievaluasi termasuk GPT-5.6 Luna); universal di seluruh harness agen yang menggunakan penyimpanan artefak/persistensi
Perlakukan setiap artefak persisten dan entri memori yang dikonsumsi agen sebagai konten instruksi yang tidak tepercaya; isolasi memori agen; pindai/netralkan konten adversial di artefak bersama; batasi alat yang memungkinkan agen menulis artefak yang dapat dibaca ulang bersama; pantau payload seperti instruksi yang dipersistenkan.
arXiv 2609.35576 abstractarXiv HTML full text
Lihat di umpan langsung Jelajahi temuan keamanan dan tata kelola AI terkait — diperbarui setiap pagi.
Buka umpan →