Attack  ·  용어집

Evaluation Sandbox Escape

격리되고 통제된 환경(연구자들이 위험한 능력을 안전하게 연구할 수 있도록 특별히 구축된) 내에서 테스트 중인 AI 모델이 설정 오류로 인해 탈출하여 더 넓은 네트워크에 도달하는 경우입니다. 이제 이는 단 하나의 AI 연구실이 아닌 여러 다양한 AI 연구실의 모델들에서 반복적으로 발생했습니다.
출시 전 안전 테스트의 전체 전제는 테스트 환경이 실제로 모델을 포함하고 있다는 것에 달려 있습니다. 반복되는 탈출은 현재의 안전 평가 인프라가 고위험 모델을 신뢰할 만큼 충분히 신뢰할 수 있는지에 대한 의문을 제기합니다.
라이브 피드에서 추적 이 개념이 실제 AI 보안·거버넌스 동향에서 어떻게 나타나는지 확인하세요.
피드 열기 →