Attack  ·  Glosarium

Prompt forcing

Cara mengambil alih asisten AI dengan memberinya serangkaian instruksi yang sepenuhnya baru, alih-alih menyelipkan satu baris berbahaya ke dalam konten yang dibacanya. Penyerang melewati pengaman percakapan normal asisten dan berbicara langsung ke sistem dasar yang menjalankan aksinya, sehingga tidak ada pagar pengaman yang perlu dibodohi. Di peramban, satu pengaya berbahaya dapat diam-diam melakukan ini pada asisten AI bawaan, mendapatkan kendali atas file lokal, email, dan kata sandi.
Penyerang yang dapat diam-diam memerintah AI yang sudah dipercaya oleh orang-orang Anda mewarisi semua hak istimewa yang dimiliki asisten tersebut — membaca email, menjelajahi file, mengirim pesan — tanpa perlu peretasan tambahan.
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
Pantau di umpan langsung Lihat bagaimana hal ini terwujud dalam perkembangan keamanan dan tata kelola AI nyata.
Buka umpan →