Attack  ·  Glosarium

Loopjacking

Cacat pada langkah 'manusia menyetujui tindakan AI', di mana layar review menampilkan satu tindakan tetapi AI sebenarnya melakukan tindakan yang berbeda dan lebih berbahaya. Ini bekerja dengan menyembunyikan tindakan nyata selama review atau dengan menukar detail segera setelah persetujuan tetapi sebelum eksekusi. Para peneliti mereproduksinya di beberapa sistem agen populer meskipun manusia telah mengklik 'setujui'.
Sebagian besar rencana keselamatan untuk agen AI bergantung pada persetujuan manusia sebagai rem terakhir; loopjacking menunjukkan rem tersebut dapat secara diam-diam diputus, sehingga satu persetujuan yang tampak tidak berbahaya dapat mengotorisasi sesuatu yang jauh lebih buruk.
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
Pantau di umpan langsung Lihat bagaimana hal ini terwujud dalam perkembangan keamanan dan tata kelola AI nyata.
Buka umpan →