정의
AI 모델의 안전성이나 성능을 테스트하는 방법으로, 테스터와 AI 회사가 서로의 기밀 정보를 볼 수 없으며, 특별한 잠금 컴퓨팅 환경('secure enclave')을 사용하여 양쪽 모두에서 블라인드 테스트를 실행합니다. 이는 회사가 알려진 테스트에 맞게 모델을 조정하는 것을 방지하고, 테스터의 독점 평가 질문을 보호합니다.
왜 중요한가
정부가 강력한 AI 모델에 대한 필수 제3자 감사로 나아가면서, 신뢰할 수 있는 블라인드 테스팅 방법은 그러한 감사가 조작되거나 유출되는 것을 방지합니다.