Definisi
Teknik jailbreak di mana penyerang menyembunyikan instruksi berbahaya dalam payload terenkripsi atau terkode sehingga filter keamanan model AI — yang biasanya memindai teks biasa — tidak pernah melihat konten berbahaya sebelum mendekripsi dan bertindak sesuai instruksi tersebut. Telah terbukti mengalahkan pemeriksaan keamanan masukan dan keluaran dari chatbot utama tanpa memerlukan klik pengguna apa pun.
Mengapa penting
Ini membuktikan bahwa guardrail keamanan saat ini dapat dilewati secara sistematis dengan trik yang dapat diulang daripada bug sekali jadi, artinya setiap produk AI yang menggunakan penyaringan serupa perlu pengujian ulang terhadap kelas serangan ini.