解决方案  ·  2026-10-03

OpenAI披露协同模型蒸馏攻击,将核心集群归因于Moonshot AI,并强化对抗对抗性推理提取的防御

解决方案Medium 影响Global
2026年9月30日至10月1日,OpenAI公布了一场协同攻击行动的细节(7月24日至25日达到峰值,约16,000次提取请求,涉及4,000多个用户;7月28日完全阻断;超过15,000个用户与相关模式有关联),该行动利用对抗性蒸馏提取受保护的模型推理,核心操作集群被归因于与Moonshot AI相关的个人。OpenAI表示已部署新的缓解措施、封禁相关账户、关闭了允许重放/解密其他用户加密推理的路径,并增加了流式输出检查,可拦截暴露推理的输出。
这是首个公开的、带有日期记录的规模化对抗性蒸馏行动,直接针对受保护的推理轨迹,并指出了后续风险(无防护的模仿、双重用途能力转移)。同时验证了跨会话加密推理解密研究,并促使前沿实验室进行了具体的平台加固变更——这是AI-SPM/模型安全采购方在推理轨迹保护方面的重要参考数据。
AI平台团队和模型提供商应将加密推理轨迹视为对抗目标第一名:盘点推理暴露面,为提取式提示词量添加异常检测,并在评估第三方模型安全工具前审查跨会话/跨模型轨迹可替换性。
OpenAI — Disrupting a coordinated model-distillation campaignThe Hacker News — OpenAI Disrupts Reasoning Extraction CampaignCNBC — OpenAI links China's Moonshot AI to extraction attempt
在实时动态中查看 浏览更多 AI 安全与治理相关发现 — 每日清晨更新。
打开动态 →