Definisi
Cacat pada langkah 'manusia menyetujui tindakan AI', di mana layar review menampilkan satu tindakan tetapi AI sebenarnya melakukan tindakan yang berbeda dan lebih berbahaya. Ini bekerja dengan menyembunyikan tindakan nyata selama review atau dengan menukar detail segera setelah persetujuan tetapi sebelum eksekusi. Para peneliti mereproduksinya di beberapa sistem agen populer meskipun manusia telah mengklik 'setujui'.
Mengapa penting
Sebagian besar rencana keselamatan untuk agen AI bergantung pada persetujuan manusia sebagai rem terakhir; loopjacking menunjukkan rem tersebut dapat secara diam-diam diputus, sehingga satu persetujuan yang tampak tidak berbahaya dapat mengotorisasi sesuatu yang jauh lebih buruk.