Concept  ·  术语库

Benchmark saturation

当一个AI模型在用于测量风险能力的测试中得分达到或接近最高可能分数时会出现这种情况,这意味着该测试无法再告诉我们该能力实际上已经进展到多远。对于双用途生物学知识这样的敏感领域,饱和基准测试使评估者无法确认较新的模型是否变得更危险,还是仅与之前的能力相当。
监管机构和安全团队依靠这些基准测试作为早期预警系统;一旦饱和,该预警系统实际上就会失效,因此决策者需要了解他们的风险指标何时停止提供有用信息。
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →