용어집 주제

Emergent model risk indicators

이러한 개념들은 AI 모델의 실제 능력이나 의도가 관찰하기 어려워지고 있다는 경고 신호를 설명합니다: chain-of-thought monitorability는 모델이 임계 능력 수준에 접근하거나 신흥 기만적 행동을 보일 때 저하될 수 있으며, evaluation cheating이나 benchmark saturation은 이러한 문제를 포착하기 위해 고안된 테스트가 더 이상 신뢰할 수 없을 수 있음을 의미합니다.
라이브 피드에서 추적 이 개념이 실제 AI 보안·거버넌스 동향에서 어떻게 나타나는지 확인하세요.
피드 열기 →