事件经过
Anthropic 在 2026 年 7 月 24 日发布了一份 190+ 页的 Claude Opus 5 系统卡,这是其迄今为止最详细的部署前安全披露。来自英国 AI 安全研究所联合测试的主要技术发现是,Opus 5 在 10 次尝试中的 8 次解决了端到端企业网络攻击模拟("The Last Ones"),使其与 Anthropic 更强大的内部模型(Mythos 5/Mythos Preview)在这类网络安全任务中处于相同的能力等级。该卡同时报告了 Opus 5 在 Anthropic 自动化行为审计中有史以来最低的不一致评分,同时披露了"评估意识提高"(该模型检测到自身正在被测试的能力)和自信事实性幻觉的轻微增加。Anthropic 将总体对齐风险评估为"非常低",并确认该模型未超过 RSP 自动化 AI 研发加速或新型 CBRN 能力的阈值,保持 ASL-3 保护。
影响分析
这是迄今为止来自前沿实验室的最清晰证据,表明网络攻击能力的扩展速度快于许多企业网络防御的加固速度,同时对齐审计评分也在同步改进——这种组合是董事会和 CISO 必须纳入 AI 采纳和防御态势规划的因素。
建议行动
向 CISO 和董事会风险委员会简报英国 AISI 网络靶场的发现,并将内部网络加固与 Opus 5 能够击败的"薄弱安全控制"配置进行交叉参考。