솔루션  ·  2026-10-03

OpenAI, 조직적 모델 증류(distillation) 공격 공개 — 핵심 클러스터를 Moonshot AI로 귀속 — 적대적 추론 추출에 대한 방어 강화

솔루션Medium 영향도Global
2026년 9월 30일~10월 1일, OpenAI는 조직적 캠페인(7월 24~25일 정점 시 4,000개 이상의 사용자 계정에서 약 16,000건의 추출 요청, 7월 28일 완전 차단, 관련 패턴에 연계된 15,000개 이상의 사용자)의 세부 정보를 공개했다. 이 캠페인은 적대적 증류를 사용해 보호된 모델 추론을 추출했으며, 핵심 운영자 클러스터는 Moonshot AI와 연계된 개인들에게 귀속되었다. OpenAI는 새로운 완화 조치를 배포하고, 계정을 차단하고, 다른 사용자의 암호화된 추론을 재생/복호화할 수 있는 경로를 차단하고, 추론을 노출하는 출력을 보류할 수 있는 스트리밍 출력 검사를 추가했다고 밝혔다.
보호된 추론 트레이스를 직접 대상으로 한 대규모 적대적 증류 작전에 대한 최초의 공개적이고 날짜가 명시된 기록이며, 후속 위험(안전장치 없는 모방, 이중 용도 능력 전이)을 명명한다. 또한 교차 세션 암호화 추론 복호화 연구를 검증하고 프론티어 랩의 구체적인 플랫폼 강화 변경을 촉발했다는 점에서 AI-SPM/모델 보안 구매자에게 추론 트레이스 보호에 대한 중요한 데이터 포인트다.
AI 플랫폼 팀과 모델 제공업체는 암호화된 추론 트레이스를 적대적 타겟 1순위로 취급해야 한다: 추론 노출 표면을 목록화하고, 추출 방식 프롬프트 볼륨에 대한 이상 탐지를 추가하고, 제3자 모델 보안 도구를 평가하기 전에 교차 세션/교차 모델 트레이스 대체 가능성을 검토하라.
OpenAI — Disrupting a coordinated model-distillation campaignThe Hacker News — OpenAI Disrupts Reasoning Extraction CampaignCNBC — OpenAI links China's Moonshot AI to extraction attempt
라이브 피드에서 보기 AI 보안 및 거버넌스 관련 소식을 더 살펴보세요 — 매일 아침 업데이트.
피드 열기 →