정의
여러 정부에 걸쳐 공동으로 개발된 첫 번째 합의된 방법론으로, 외부 전문가가 AI 시스템의 안전성과 기능을 어떻게 테스트하고 측정해야 하는지에 관한 것입니다. 모든 국가나 연구소가 자체 기준으로 AI를 평가하는 대신 공통의 척도를 만드는 것입니다. 서로 다른 테스터의 평가가 실제로 비교 가능하도록 하기 위한 것입니다.
왜 중요한가
'독립적인 AI 안전 테스트' 주장에 의존하는 보드는 해당 테스트가 이와 같은 인정된 정부 간 방법론을 따르는지, 아니면 임시적이고 검증 불가능한 프로세스를 따르는지 알아야 합니다.