취약점  ·  2026-08-13

새로운 크로스 제공자 공격으로 OpenAI, Anthropic 및 Google LLM API의 숨겨진 사고 연쇄(chain-of-thought) 추론 추적을 해독합니다

취약점High 영향도Global
ELLIS Institute Tübingen, Max Planck Institute, MATS Research 및 Snyk의 공동 연구팀이 'Stealing Reasoning Traces from Proprietary LLM APIs' (arXiv 2608.09867)를 발표했으며, OpenAI, Anthropic 및 Google이 암호화된 사고 연쇄 은폐를 구현하는 방식의 아키텍처 결함을 공개하여, 세 제공자의 추론 모델 생태계 전반에 걸쳐 확장 가능한 해독 탈옥을 가능하게 합니다.
이는 동시에 세 가장 큰 프론티어 모델 API 제공자에 영향을 미치는 새로운 크로스 제공자 공격 클래스입니다 — 단일 제공자 버그가 아닙니다. 이는 소유 추론 추적에 대한 지적 재산권 보호를 무효화하고, 공개 저장소에서 실시간 유출된 PII/자격 증명을 규모에 따라 노출하며, 보이는 출력이 숨기도록 설계된 위험한 정보를 드러낼 수 있고, 공개 에이전트 데이터 집합에 보이지 않는 프롬프트 주입을 위한 채널을 만듭니다. 제공자는 몇 개월 전에 공개를 받았지만 이를 재현 가능/실행 가능한 것으로 취급하지 않았습니다.
추론 모델 API에서 반환된 암호화된 추론 블록은 제공자의 생태계 내에서 세션, 사용자 및 모델 전체에서 완전히 호환/교환 가능합니다. 공격자는 더 강하고 더 잘 보호된 모델에서 캡처한 암호화된 추론 추적을 동일한 제공자의 더 약하고 덜 보호된 형제 모델에 주입합니다. 더 약한 모델이 더 강한 모델을 직접 탈옥하지 않고도 추적을 일반 텍스트로 그대로 해독하고 출력합니다. 입증된 공격 벡터에는 반증류 우회, 공개적으로 공유된 세션 로그에서 대규모 PII/자격 증명 추출(스크랩된 315,320개의 추론 블록에서 367개의 PII 인공물 및 182개의 자격 증명 복구), 최종 출력이 거부할 때도 추론에 숨겨진 위험한 정보의 공개, 암호화된 블록 내에만 포함된 보이지 않는 프롬프트 주입으로 공개 에이전트 출시에 독을 포함시키기가 포함됩니다.
OpenAI GPT-5.6 API, Anthropic Claude Opus 4.8 API, Google Gemini 3 API (암호화/불투명 사고 연쇄 추론 블록 아키텍처)
연구원은 제공자에게 책임감 있게 공개했으며 암호화/시스템 수준 완화를 제안합니다(예: 추론 블록을 세션/사용자/모델 신원에 바인딩, 크로스 모델 재생 비활성화). 공개 기준으로 확인된 공급자 패치가 없습니다 — 세션 로그를 공개적으로 공유하는 조직은 암호화된 추론 블록을 민감한 것으로 취급하고 수정해야 합니다.
arXiv: Stealing Reasoning Traces from Proprietary LLM APIsHugging Face Papers listing
라이브 피드에서 보기 AI 보안 및 거버넌스 관련 소식을 더 살펴보세요 — 매일 아침 업데이트.
피드 열기 →