事件经过
AI 安全非营利组织 FAR.AI 于 2026 年 7 月 29 日推出 leaderboard.far.ai,这是一个独立的公开基准测试,针对 CBRNE 和网络领域的 60+ 越狱技术测试前沿模型的保障措施,发现模型之间的鲁棒性差距超过 100 倍(Grok 4.5/Gemini 3.1 Pro 在 <$300 时被破解;Claude Fable 5/GPT-5.6 Sol 维持在 $14,200 以上),同时发布了新的《保障措施最低标准 v1.0》基线。
影响分析
提供首个标准化、跨厂商、基于成本的 AI 越狱鲁棒性指标,为企业和监管机构提供了一种独立的方式来比较前沿模型的安全声明,而不是依赖于厂商自我报告。
适用范围
为为高风险部署选择/审查前沿模型的 CISO 和 AI 治理团队;起草 AI 安全基线的政策制定者。