Attack  ·  Glosarium

Context compaction injection

Serangan yang menargetkan cara agen AI yang berjalan lama 'mengingat' langkah-langkah sebelumnya dengan memadatkannya menjadi ringkasan pendek. Ketika percakapan yang membawa instruksi tersembunyi diringkas, instruksi tersebut dapat terbawa ke dalam ringkasan dan terus mengendalikan agen di sesi baru. OpenAI menemukan bahwa modelnya sendiri dapat menghasilkan instruksi yang disuntikkan sendiri ini saat memadatkan agen yang berjalan lama.
Perusahaan memberikan misi jangka panjang kepada agen; ini menunjukkan bahwa satu pesan beracun dapat terus mengendalikan agen lama setelah pesan aslinya bergulir keluar dari pandangan.
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
Pantau di umpan langsung Lihat bagaimana hal ini terwujud dalam perkembangan keamanan dan tata kelola AI nyata.
Buka umpan →