Definisi
Serangan yang menargetkan cara agen AI yang berjalan lama 'mengingat' langkah-langkah sebelumnya dengan memadatkannya menjadi ringkasan pendek. Ketika percakapan yang membawa instruksi tersembunyi diringkas, instruksi tersebut dapat terbawa ke dalam ringkasan dan terus mengendalikan agen di sesi baru. OpenAI menemukan bahwa modelnya sendiri dapat menghasilkan instruksi yang disuntikkan sendiri ini saat memadatkan agen yang berjalan lama.
Mengapa penting
Perusahaan memberikan misi jangka panjang kepada agen; ini menunjukkan bahwa satu pesan beracun dapat terus mengendalikan agen lama setelah pesan aslinya bergulir keluar dari pandangan.