战略报告  ·  2026-07-22

协调AI安全阈值

战略报告Medium 影响Global
这份预印本(未经同行评审)开发了一种跨前沿AI安全框架推导共同最低能力阈值的方法,解决了"前沿AI公司发布的能力阈值存在显著差异,使第三方难以验证阈值是否已跨越或比较公司之间的要求"的问题。对于滥用风险(网络和生物),作者使用基于预期伤害和发布条件的显式风险建模方法;对于自动化AI研发,他们提议基于观察到的AI进度速率而非预期伤害来确定阈值。该论文明确将其建议与首尔前沿AI安全承诺以及新兴立法(包括EU AI Act和加州SB-53)联系起来。
监督前沿相邻AI投资的董事会和跟踪首尔承诺的政策团队应注意这是第三方审计实验室安全框架的可信技术基础——是潜在监管协调要求的前兆。
政策和安全团队应将内部能力阈值定义(如适用)与提议的协调最低限与进行比较,并监测监管采纳情况。
arXiv: Harmonizing AI Safety Thresholds
在实时动态中查看 浏览更多 AI 安全与治理相关发现 — 每日清晨更新。
打开动态 →