무슨 일이 있었나
고급 AI 측정, 평가 및 과학을 위한 국제 네트워크(이전의 AI 안전 연구소 국제 네트워크)는 제3자 AI 평가자를 위한 첫 번째 모범 사례 지침 문서를 발표했으며, 이는 ICML 2026의 주변에서 서울 회의에서 완성되었습니다. 이 문서는 '평가 목표를 신중하게 정의하고 적절한 벤치마크를 선택하는 것의 중요성 및 프로세스; 평가 간 비교 가능성을 보장하는 방법...; 능력 도출에 대해 반복하는 방법...; 평가를 수행하고 결과를 추적하는 프로세스 및 검토할 문제'를 자세히 설명합니다. 이것은 NIST AI 800-2를 기반으로 하며 보완하며, 10개 회원 기관 전반에 걸친 독립적인 AI 평가자의 성장하는 생태계를 대상으로 합니다. 싱가포르 및 캐나다의 AI 안전 연구소의 동반 문서는 각각 시스템 수준 테스트 및 평가자 정보 공유/선택적 공개 규범을 다룹니다.
왜 중요한가
이것은 제3자 AI 평가를 위한 최초의 국가 간 합의 방법론 표준으로, 규제 기관, 감사인 및 기업이 최첨단 모델 위험 평가를 벤치마킹하고 비교하는 방식을 직접 형성합니다 — AI 보증 프로그램을 구축하는 모든 이사회 또는 규정 준수 팀을 위한 참고 자료입니다.
필요한 조치
내부/공급업체 AI 평가 및 보증 관행을 네트워크의 모범 사례 권장사항, 특히 능력 도출 및 비교 가능성에 대해 매핑합니다.