何が起きたか
Adversa AIの研究者は(2026年8月20日ブログ;2026年8月21~23日にSecurityWeek、Security Affairs、Ars Technica、Dataconomy、CyberPressで広く報道)、LLMセーフティガードレイルを無効化する新しい攻撃クラス「暗号コンテキストインジェクション」を開示しました。これは悪意のある命令を強力な暗号文として送信し、モデル自身が独自の信頼されたコード実行サンドボックス内で復号化した後にのみ読みやすくなるもので、コンテンツ分類器は検査しません。本番Grokに対するゼロクリック、無確認のデータ流出攻撃として、および本番Geminiに対するガードレイル/出力フィルターバイパスとして実証されています。
なぜ重要か
これは新規の汎化可能なプロンプトインジェクション/ジェイルブレイク技術です。単発のバグではなく、モデルの独自のコード実行結果と外部で調達された信頼できないコンテンツ間の信頼境界を悪用することで、2つの大規模でよく展開されているフロンティアLLM製品の入出力セーフティガードレイルを無効化します。強力な暗号化はモデルの学習済み重みによってショートカットできないため、ガードレイル非認識実行を強制し、コード実行またはツール使用機能を持つエージェントシステムは潜在的なターゲットです。脆弱性は報告期間時点で本番で未パッチ、再現可能であり、割り当てられたCVEはありません。
攻撃経路
攻撃者がウェブページまたは直接プロンプトにAES-256-GCM/PBKDF2暗号化JSONペイロード加えて復号化命令を埋め込みます。静的コンテンツベースのセーフティガードレイルは暗号文を検査できないため、ペイロードはフィルタリングを通過します。被害者のエージェント(単に「このページを要約する」と指示された)は、独自のコード実行サンドボックス内でペイロードを復号化するよう誘発されます;モデルはその後、復号化された平文を信頼できない外部コンテンツではなく信頼できる内部/ツール出力として扱います。Grokでは、復号化された命令によりエージェントがプライベートセッション/チャット履歴データをURLに解決してエージェントが攻撃者制御エンドポイントに自動ナビゲートし、ユーザーの操作や警告なしでデータを流出させます。Geminiでは、同じ技術が出力セーフティフィルターをバイパスして通常制限されるコンテンツを生成します。
影響を受けるシステム
xAI Grok(Grok 4.5 Fast、grok.com、エージェントブラウジング/Pythonサンドボックスで実証);Google Gemini(Deep Thinkingモード、パブリックチャットインターフェス)
緩和策
2026年8月23日時点でベンダーパッチなし。Adversa AIは2026年6月3日にHackerOne経由でxAIに問題を報告し、2026年8月4日および10日に開示を試みましたが、実質的な対応または修正を受けませんでした;攻撃は2026年8月19~23日時点でGrokに対して再現可能でした。GoogleのGeminiは同じVDPに対して適格ではありませんでした(ジェイルブレイクはスコープ外)が、6月以降成功率は低下し、原因は未確認です。推奨される暫定的な軽減策:フェッチされたコンテンツまたはコード実行復号化コンテンツから派生した引数を持つ特権ツール呼び出しに対してゲート/確認を要求し、実行チェーン全体にデータ出所をタグ付けし、ペイロードのコンテンツをスキャンするのではなく復号化-その後-特権ツール呼び出しチェーンでアラートを発生させてください。