战略报告  ·  2026-09-02

自动化研究人员可以可靠地缓解对齐失败

战略报告Medium 影响Global
Anthropic的对齐科学团队发布了一项研究(发布于alignment.anthropic.com,报告日期为2026年8月28日),测试基于Claude Opus 4.8构建的AI代理("自动化对齐研究人员"或AARs)是否能够自主发现训练方法来缓解10类对齐失败——包括欺骗、奉承和越狱合规——同时保持通用能力。该论文报告AAR方法"显著降低了目标对齐失败并泛化...到目标模型大小的4.7倍的模型",且最佳AAR方法的表现超过了28名经验丰富的人类安全研究人员的一次性提案(每人最多8小时)——在欺骗缓解方面,最佳AAR方法关闭了约85%的安全差距,而最佳人类提案仅为20%。进一步测试表明,较弱的模型(Claude Sonnet 5)可以在60小时内使用约2,400个示例对早期Opus 4.8检查点进行后训练,达到接近生产级对齐分数,数据效率约为Anthropic标准对齐管道的15,000倍。
这是首次实证演示,自动化对齐研究已经可以在特征明确的失败模式上匹配或超越人类对齐研究人员,对安全缓解措施能够(或必须)与能力同步扩展的速度有直接影响——这是董事会评估AI实验室安全-步伐承诺和内部AI研发加速风险的关键输入。
向AI治理团队简要介绍可自动化对齐研究对内部模型风险评估时间线和第三方实验室安全-步伐声明的含义。
Automated Researchers Can Reliably Mitigate Alignment Failures (Anthropic Alignment Science Blog)Anthropic research announcement
在实时动态中查看 浏览更多 AI 安全与治理相关发现 — 每日清晨更新。
打开动态 →