事件经过
2026年9月30日至10月1日,OpenAI公布了一场协同攻击行动的细节(7月24日至25日达到峰值,约16,000次提取请求,涉及4,000多个用户;7月28日完全阻断;超过15,000个用户与相关模式有关联),该行动利用对抗性蒸馏提取受保护的模型推理,核心操作集群被归因于与Moonshot AI相关的个人。OpenAI表示已部署新的缓解措施、封禁相关账户、关闭了允许重放/解密其他用户加密推理的路径,并增加了流式输出检查,可拦截暴露推理的输出。
影响分析
这是首个公开的、带有日期记录的规模化对抗性蒸馏行动,直接针对受保护的推理轨迹,并指出了后续风险(无防护的模仿、双重用途能力转移)。同时验证了跨会话加密推理解密研究,并促使前沿实验室进行了具体的平台加固变更——这是AI-SPM/模型安全采购方在推理轨迹保护方面的重要参考数据。
适用范围
AI平台团队和模型提供商应将加密推理轨迹视为对抗目标第一名:盘点推理暴露面,为提取式提示词量添加异常检测,并在评估第三方模型安全工具前审查跨会话/跨模型轨迹可替换性。