定义 第一个由多个政府联合开发的商定方法论,用于指导外部专家如何测试和衡量AI系统的安全性和能力——创建了一个共同的衡量标准,而不是每个国家或实验室都按自己的方式对AI进行评分。其目的是使来自不同测试者的评估结果真正具有可比性。 影响分析依赖"独立AI安全测试"声明的董事会应该了解该测试是遵循公认的跨政府方法论(如本方法论),还是遵循临时性的、无法验证的流程。