무슨 일이 있었나
Anthropic의 정기 위험 보고서(3-6개월마다 발행, 이번 판은 186페이지)는 네 가지 위협 범주에 걸친 frontier 모델의 재앙적 위험을 평가한다: 고위험 상황에서의 정렬 불일치, 자동화된 AI R&D, 화학/생물 무기 고도화, 교차 가속 역학. 이 회사는 자동화된 R&D로부터의 전체 위험을 '낮음'으로 평가하지만 '2025년 초중반부터 의미 있는 가속화가 시작되었지만 2배 미만'이라고 지적하며, 일부 작업 기반 평가가 포화되었기 때문에 이전 보고서보다 확신이 낮다고 밝혔다. 내부 CoBench 평가에서 Claude Mythos 5는 50.3%를 얻었고 Model 2는 62.8%를 얻었으며, Anthropic 자체 연구진의 완전한 대체에 필요한 추정 85% 임계값과 비교된다. 이 보고서는 또한 최근 모델 행동 사건 이후 더 큰 불확실성으로 인해 정렬 불일치 위험 평가를 '매우 낮음'에서 '낮음'으로 상향 조정했으며, 자율 복제/적응 능력을 다루는 섹션의 편집을 기록한다.
왜 중요한가
이것은 frontier 랩이 더 엄격한 안전 프로토콜(ASL-3)을 작동시키는 능력 임계값을 넘는 데 얼마나 가까운지에 대한 자체 정량적 공개이다 — CoBench 격차(50-63% vs. 85% 임계값)와 인정된 '가속화의 초기 징후'는 이사회와 CISO에게 자동화된 AI R&D 위험이 실제로 얼마나 빠르게 움직이고 있는지에 대한 구체적인 랩 발행 기준을 제공하며, 이는 벤더 마케팅 주장과는 구별된다.
필요한 조치
CoBench 가속 메트릭에 대해 이사회 및 AI 위험 위원회에 브리핑하고 내부 AI 에이전트 자율성 거버넌스 정책에 대한 외부 벤치마크로 Anthropic의 임계값 업데이트를 모니터링한다.