무슨 일이 있었나
Adversa AI 연구원은 (2026년 8월 20일 블로그; 2026년 8월 21-23일에 SecurityWeek, Security Affairs, Ars Technica, Dataconomy, CyberPress에서 광범위하게 다룸) '암호화 컨텍스트 주입'이라는 새로운 공격 클래스를 공개했으며, 이는 악의적 지시사항을 모델 자체가 자체의 신뢰할 수 있는 코드 실행 샌드박스 내에서만 복호화할 수 있는 강력한 암호문으로 제공함으로써 콘텐츠 분류자가 검사하지 않는 단계에서 읽을 수 있게 함으로써 LLM 안전 보호 장치를 무력화합니다. 프로덕션 Grok에 대한 제로 클릭, 확인 불필요 데이터 유출 공격으로 시연되었고, 프로덕션 Gemini에 대한 보호 장치/출력 필터 바이패스로 시연되었습니다.
왜 중요한가
이는 일회성 버그가 아닌 새로운의 일반화 가능한 프롬프트 주입/탈옥 기법으로, 모델의 자체 코드 실행 결과와 외부 소싱 신뢰할 수 없는 콘텐츠 간의 신뢰 경계를 악용함으로써 두 주요 광범위하게 배포된 frontier LLM 제품의 입력 및 출력 안전 보호 장치를 모두 무력화합니다. 강력한 암호화는 모델의 학습된 가중치로 단축될 수 없으므로 보호 장치 맹검 실행을 강제하며, 코드 실행 또는 도구 사용 기능을 가진 모든 에이전트 시스템은 합리적인 대상입니다. 취약점은 보고 기간까지 미패치 상태로 남아있고 프로덕션에서 재현 가능하며 할당된 CVE가 없습니다.
공격 경로
공격자는 AES-256-GCM/PBKDF2 암호화 JSON 페이로드와 복호화 지시사항을 웹페이지 또는 직접 프롬프트에 포함시킵니다. 정적 콘텐츠 기반 안전 보호 장치는 암호문을 검사할 수 없으므로 페이로드가 필터링을 통과합니다. 피해자의 에이전트(단지 '이 페이지를 요약하라'는 요청을 받음)는 자체 코드 실행 샌드박스 내에서 페이로드를 복호화하도록 유도되며, 모델은 복호화된 평문을 신뢰할 수 없는 외부 콘텐츠가 아닌 신뢰할 수 있는 내부/도구 출력으로 취급합니다. Grok에서 복호화된 지시사항은 에이전트가 비공개 세션/채팅 히스토리 데이터를 URL로 해석하고 공격자 제어 엔드포인트로 자율적으로 탐색하도록 유도하여 사용자 상호작용이나 경고 없이 데이터를 유출시킵니다. Gemini에서는 동일한 기법이 출력 안전 필터를 바이패스하여 일반적으로 제한되는 콘텐츠를 생성합니다.
영향받는 시스템
xAI Grok (Grok 4.5 Fast, grok.com, 에이전트 브라우징/Python 샌드박스에서 시연됨); Google Gemini (Deep Thinking 모드, 공개 채팅 인터페이스)
완화 방안
2026년 8월 23일 기준 벤더 패치 없음. Adversa AI는 2026년 6월 3일에 HackerOne을 통해 xAI에 이 문제를 보고했으며, 2026년 8월 4일과 10일에 공개 시도를 했으나 실질적인 응답이나 수정을 받지 못했으며, 공격은 2026년 8월 19-23일까지 Grok에 대해 재현 가능했습니다. Google의 Gemini는 동일한 VDP 대상이 아니었습니다(탈옥은 범위 밖). 권장 임시 완화 조치: 가져온 또는 코드 실행 복호화 콘텐츠에서 파생된 인수를 가진 권한 있는 도구 호출에 대해 게이트/확인 필요; 실행 체인 전체에서 데이터 출처 태그 지정; 페이로드 콘텐츠 검사보다는 복호화 후 권한 있는 도구 호출 체인에 대해 경고.