战略报告  ·  2026-08-16

Anthropic 八月 2026 年风险报告(已编辑)

战略报告High 影响Global
Anthropic 的定期风险报告(每 3-6 个月发布一次,本版共 186 页)评估其前沿模型在四个威胁类别中的灾难性风险:高风险环境中的目标不一致、自动化 AI 研发、化学/生物武器提升和跨领域加速动态。该公司将自动化研发的总体风险评为"低",但指出"从 2025 年初至中期开始有明显加速,尽管加速幅度小于 2 倍",并表示相比之前的报告信心下降,因为一些基于任务的评估已经饱和。在其内部 CoBench 评估中,Claude Mythos 5 的得分为 50.3%,Model 2 的得分为 62.8%,而 Anthropic 自身研究人员完全替代的估计阈值为 85%。该报告还将目标不一致风险等级从"非常低"上调至"低",原因是近期模型行为事件引发的更大不确定性,并记录了涉及自主复制/适应能力的章节编辑。
这是一家前沿实验室自身定量披露其模型距离触发更严格安全协议(ASL-3)的能力阈值有多接近——CoBench 差距(50-63% 对比 85% 阈值)和承认的"加速早期迹象"为董事会和 CISOs 提供了一个具体的、由实验室发布的衡量标准,用于了解自动化 AI 研发风险实际移动的速度,这与供应商营销宣传不同。
向董事会和 AI 风险委员会汇报 CoBench 加速指标,并监测 Anthropic 的阈值更新,作为内部 AI 代理自主治理政策的外部基准。
Anthropic — Redacted Risk Report August 2026Anthropic CDN — Redacted Risk Report August 2026 (PDF)
在实时动态中查看 浏览更多 AI 安全与治理相关发现 — 每日清晨更新。
打开动态 →