漏洞  ·  2026-08-13

新颖的跨提供商攻击解密 OpenAI、Anthropic 和 Google LLM API 中的隐藏思维链推理跟踪

漏洞High 影响Global
来自 ELLIS Institute Tübingen、Max Planck Institute、MATS Research 和 Snyk 的联合研究团队发表了《从专有 LLM API 窃取推理跟踪》(arXiv 2608.09867),披露了 OpenAI、Anthropic 和 Google 如何实现加密思维链隐蔽的架构缺陷,在所有三个提供商的推理模型生态系统中实现可扩展的解密越狱。
这是一个影响三个最大前沿模型 API 供应商的新颖、跨提供商攻击类别 — 不是单一供应商缺陷。它击败了对专有推理跟踪的知识产权保护,大规模暴露了从公开存储库泄露的真实世界 PII/凭据,可以显示可见输出被设计隐藏的危险信息,并为对公开代理数据集的隐形提示注入创建了一个通道。提供商据报告提前几个月收到披露,但没有将其视为可复现/可操作。
由推理模型 API 返回的加密推理块在提供商生态系统内完全兼容/可互换的跨会话、用户和模型。攻击者从更强、更受保护的模型注入捕获的加密推理跟踪到同一提供商的更弱、防护较少的同级模型;较弱的模型解码并以纯文本方式逐字输出跟踪,从不直接越狱更强的模型。演示的攻击向量包括反蒸馏绕过、从公开共享的会话日志大规模 PII/凭据提取(从 315,320 个抓取的推理块中恢复了 367 个 PII 工件和 182 个凭据)、披露推理中隐藏的危险信息,即使最终输出拒绝,以及完全嵌入在加密块内的隐形提示注入,以毒害公开代理推出。
OpenAI GPT-5.6 API、Anthropic Claude Opus 4.8 API、Google Gemini 3 API(加密/不透明思维链推理块架构)
研究人员负责任地向提供商披露并提议加密/系统级缓解措施(例如,将推理块绑定到会话/用户/模型身份,禁用跨模型重放);根据披露没有确认的公开供应商补丁 — 公开共享会话日志的组织应将加密推理块视为敏感并将其编辑掉。
arXiv: Stealing Reasoning Traces from Proprietary LLM APIsHugging Face Papers listing
在实时动态中查看 浏览更多 AI 安全与治理相关发现 — 每日清晨更新。
打开动态 →