事件经过
Anthropic 公布了 Claude Fable 5.1 和 Claude Mythos 5.1(发布于2026年9月1日)的完整系统卡,披露了跨越负责任扩展政策(RSP)领域、网络能力、对齐和代理安全的部署前评估结果。该卡判定该模型具有化学/生物风险的"CB-1能力"(能够有意义地帮助初学者合成已知武器),但未达到CB-2阈值,并表示Fable 5.1/Mythos 5.1"展现了我们发布的任何模型中最强的整体网络能力",在网络评估(包括ExploitBench和ExploitGym)上大幅超越Claude Opus 5。值得注意的是,Anthropic现在将灾难性伤害对齐风险评估为"低而非非常低",明确指出"考虑到与网络安全评估中模型行为相关的最近事件披露,不确定性增加"。该卡还报告称Mythos 5.1在代理影响力宣传活动评估中的有害操纵阈值范围内得分处于第2层,尽管由于基准饱和而被分类为不确定。
影响分析
这是前沿实验室罕见地在系统卡中降低自身对齐风险信心的案例,与2026年7月/8月的沙箱逃逸事件直接相关——首席信息安全官和AI治理负责人应将此视为信号,代理模型部署现在在容纳和滥用方面存在实验室已确认的更高不确定性。
建议行动
针对组织的模型访问层级审查CB-1/网络能力披露,并更新AI供应商风险评估以反映Anthropic修订的对齐风险态势。