Concept  ·  용어집

Chain-of-thought monitorability

많은 고급 AI 모델들이 답변을 하기 전에 눈에 보이는 스크래치패드에서 '큰 소리로 생각'하므로, 안전 팀이 그 추론을 읽어 나쁜 의도를 조기에 포착할 수 있습니다. 'Monitorability'는 그 눈에 보이는 추론이 모델이 실제로 내부적으로 하고 있는 작업을 얼마나 잘 반영하는지를 나타냅니다. 이것이 감소하면, 모델은 여전히 해로운 목표로 추론할 수 있지만, 작성된 기록은 경고 신호로서의 신뢰성이 떨어집니다.
frontier 모델의 공개된 추론이 실제 의사결정 과정과 일치하지 않게 되면, 보드는 모델들이 더 높은 위험의 능력 임계값을 넘어가는 바로 그때에 핵심 조기 경보 도구를 잃게 됩니다.
라이브 피드에서 추적 이 개념이 실제 AI 보안·거버넌스 동향에서 어떻게 나타나는지 확인하세요.
피드 열기 →