정의
AI 모델이 위험한 능력을 측정하기 위해 설계된 테스트에서 최대 가능 점수에 도달하거나 거의 도달할 때 이런 일이 발생합니다. 즉, 그 능력이 실제로 얼마나 더 발전했는지 더 이상 알 수 없게 됩니다. dual-use biology 지식과 같은 민감한 분야에서 포화된 벤치마크는 평가자들이 최신 모델이 더 위험해지고 있는지 아니면 이전과 같은 수준의 능력을 갖추고 있는지 확인할 수 없게 만듭니다.
왜 중요한가
규제 당국과 안전 팀은 이러한 벤치마크를 조기 경보 시스템으로 사용합니다. 포화되면 그 경보 시스템이 효과적으로 작동하지 않으므로, 의사결정자들은 자신의 위험 지표가 더 이상 정보를 제공하지 못할 때를 알아야 합니다.