무슨 일이 있었나
ELLIS Institute Tübingen, Max Planck Institute, MATS Research 및 Snyk의 공동 연구팀이 'Stealing Reasoning Traces from Proprietary LLM APIs' (arXiv 2608.09867)를 발표했으며, OpenAI, Anthropic 및 Google이 암호화된 사고 연쇄 은폐를 구현하는 방식의 아키텍처 결함을 공개하여, 세 제공자의 추론 모델 생태계 전반에 걸쳐 확장 가능한 해독 탈옥을 가능하게 합니다.
왜 중요한가
이는 동시에 세 가장 큰 프론티어 모델 API 제공자에 영향을 미치는 새로운 크로스 제공자 공격 클래스입니다 — 단일 제공자 버그가 아닙니다. 이는 소유 추론 추적에 대한 지적 재산권 보호를 무효화하고, 공개 저장소에서 실시간 유출된 PII/자격 증명을 규모에 따라 노출하며, 보이는 출력이 숨기도록 설계된 위험한 정보를 드러낼 수 있고, 공개 에이전트 데이터 집합에 보이지 않는 프롬프트 주입을 위한 채널을 만듭니다. 제공자는 몇 개월 전에 공개를 받았지만 이를 재현 가능/실행 가능한 것으로 취급하지 않았습니다.
공격 경로
추론 모델 API에서 반환된 암호화된 추론 블록은 제공자의 생태계 내에서 세션, 사용자 및 모델 전체에서 완전히 호환/교환 가능합니다. 공격자는 더 강하고 더 잘 보호된 모델에서 캡처한 암호화된 추론 추적을 동일한 제공자의 더 약하고 덜 보호된 형제 모델에 주입합니다. 더 약한 모델이 더 강한 모델을 직접 탈옥하지 않고도 추적을 일반 텍스트로 그대로 해독하고 출력합니다. 입증된 공격 벡터에는 반증류 우회, 공개적으로 공유된 세션 로그에서 대규모 PII/자격 증명 추출(스크랩된 315,320개의 추론 블록에서 367개의 PII 인공물 및 182개의 자격 증명 복구), 최종 출력이 거부할 때도 추론에 숨겨진 위험한 정보의 공개, 암호화된 블록 내에만 포함된 보이지 않는 프롬프트 주입으로 공개 에이전트 출시에 독을 포함시키기가 포함됩니다.
영향받는 시스템
OpenAI GPT-5.6 API, Anthropic Claude Opus 4.8 API, Google Gemini 3 API (암호화/불투명 사고 연쇄 추론 블록 아키텍처)
완화 방안
연구원은 제공자에게 책임감 있게 공개했으며 암호화/시스템 수준 완화를 제안합니다(예: 추론 블록을 세션/사용자/모델 신원에 바인딩, 크로스 모델 재생 비활성화). 공개 기준으로 확인된 공급자 패치가 없습니다 — 세션 로그를 공개적으로 공유하는 조직은 암호화된 추론 블록을 민감한 것으로 취급하고 수정해야 합니다.