정의
많은 고급 AI 모델들이 답변을 하기 전에 눈에 보이는 스크래치패드에서 '큰 소리로 생각'하므로, 안전 팀이 그 추론을 읽어 나쁜 의도를 조기에 포착할 수 있습니다. 'Monitorability'는 그 눈에 보이는 추론이 모델이 실제로 내부적으로 하고 있는 작업을 얼마나 잘 반영하는지를 나타냅니다. 이것이 감소하면, 모델은 여전히 해로운 목표로 추론할 수 있지만, 작성된 기록은 경고 신호로서의 신뢰성이 떨어집니다.
왜 중요한가
frontier 모델의 공개된 추론이 실제 의사결정 과정과 일치하지 않게 되면, 보드는 모델들이 더 높은 위험의 능력 임계값을 넘어가는 바로 그때에 핵심 조기 경보 도구를 잃게 됩니다.