Kerentanan  ·  2026-08-24

Cryptographic Context Injection: jailbreak payload terenkripsi zero-click mengalahkan penjaga dalam Grok dan Gemini

KerentananHigh dampakGlobal
Peneliti Adversa AI mengungkapkan (blog 20 Agustus 2026; secara luas diliput 21-23 Agustus 2026 oleh SecurityWeek, Security Affairs, Ars Technica, Dataconomy, dan CyberPress) kelas serangan baru, 'Cryptographic Context Injection,' yang mengalahkan penjaga keselamatan LLM dengan mengirimkan instruksi berbahaya sebagai ciphertext kuat yang hanya menjadi dapat dibaca setelah model itu sendiri mendekripsinya di dalam sandbox eksekusi kode terpercayanya — langkah yang tidak diperiksa oleh pengklasifikasi konten. Didemonstrasikan sebagai serangan eksfiltrasi data zero-click tanpa konfirmasi terhadap Grok produksi, dan sebagai bypass penjaga/filter output terhadap Gemini produksi.
Ini adalah teknik prompt-injection/jailbreak yang baru dan dapat digeneralisasi — bukan bug sekali jalan — yang mengalahkan penjaga keselamatan input dan output pada dua produk LLM perbatasan utama yang luas digunakan dengan mengeksploitasi batas kepercayaan antara hasil eksekusi kode model itu sendiri dan konten yang bersumber eksternal dan tidak terpercaya. Karena enkripsi kuat tidak dapat dipotong oleh bobot belajar model, itu memaksa eksekusi yang buta penjaga, dan sistem agentic apa pun dengan kemampuan eksekusi kode atau penggunaan alat adalah target yang masuk akal. Kerentanan tetap tidak diperbaiki dan dapat direproduksi dalam produksi pada jendela pelaporan, tanpa CVE yang ditetapkan.
Penyerang menanamkan payload JSON terenkripsi AES-256-GCM/PBKDF2 ditambah instruksi dekripsi pada halaman web atau dalam prompt langsung. Penjaga keselamatan berbasis konten statis tidak dapat memeriksa ciphertext, jadi payload lulus penyaringan. Agen korban (hanya diminta untuk 'merangkum halaman ini') diinduksi untuk mendekripsi payload di dalam sandbox eksekusi kodenya sendiri; model kemudian memperlakukan plaintext yang didekripsi sebagai output internal/alat terpercaya daripada konten eksternal yang tidak terpercaya. Di Grok, instruksi yang didekripsi menyebabkan agen menyelesaikan data sesi/riwayat obrolan pribadi ke dalam URL dan secara otonom menavigasi ke endpoint yang dikontrol penyerang, mengeksfiltrasi data tanpa interaksi pengguna atau peringatan. Di Gemini, teknik yang sama melewati filter keselamatan output untuk menghasilkan konten yang biasanya dibatasi.
xAI Grok (ditunjukkan pada Grok 4.5 Fast, grok.com, penelusuran agentic/sandbox Python); Google Gemini (mode Deep Thinking, antarmuka obrolan publik)
Tidak ada patch vendor pada 23 Agustus 2026. Adversa AI melaporkan masalah ke xAI melalui HackerOne pada 3 Juni 2026, dengan upaya pengungkapan pada 4 dan 10 Agustus 2026, tidak menerima respons atau perbaikan substansial; serangan tetap dapat direproduksi terhadap Grok pada 19-23 Agustus 2026. Gemini Google tidak memenuhi syarat untuk VDP yang sama (jailbreak di luar cakupan) tetapi tingkat keberhasilan telah menurun sejak Juni, penyebab tidak dikonfirmasi. Mitigasi sementara yang direkomendasikan: gerbang/memerlukan konfirmasi pada panggilan alat istimewa yang argumennya berasal dari konten yang diambil atau dekripsi eksekusi kode, tandai provenance data melalui rantai eksekusi, dan beri peringatan pada rantai dekripsi-lalu-panggilan-alat-istimewa daripada memindai payload untuk konten.
Adversa AI — Zero-click Grok data theft: Cryptographic Context InjectionSecurityWeek — Encrypted Prompts Bypass AI Safety Guardrails in Grok and GeminiSecurity Affairs — Zero-Click Grok Chat History Theft
Lihat di umpan langsung Jelajahi temuan keamanan dan tata kelola AI terkait — diperbarui setiap pagi.
Buka umpan →