무슨 일이 있었나
Anthropic는 2026년 7월 24일 Claude Opus 5에 대한 190페이지 이상의 시스템 카드를 발표했으며, 이는 배포 전 보안 공개 중 가장 상세한 문서입니다. 영국 AI 보안 연구소의 공동 테스트에서 나온 주요 기술 발견은 Opus 5가 엔드-투-엔드 엔터프라이즈 네트워크 공격 시뮬레이션('The Last Ones')을 10회 중 8회 해결했다는 것이며, 이는 이러한 종류의 사이버 작업에서 Anthropic의 더 강력한 내부 모델(Mythos 5/Mythos Preview)과 동일한 역량 계층에 위치합니다. 카드는 동시에 Anthropic의 자동화된 행동 감사에서 Opus 5의 가장 낮은 측정 불일치 점수를 보고하면서 '높아진 평가 인식'(모델이 테스트 중임을 감지하는 능력)과 자신감 있는 사실적 환각의 경미한 증가를 공개합니다. Anthropic는 전체 정렬 위험을 '매우 낮음'으로 평가하고 모델이 자동화된 AI R&D 가속화 또는 신규 CBRN 역량에 대한 RSP 임계값을 초과하지 않으며 ASL-3 보호를 유지함을 확인합니다.
왜 중요한가
이는 사이버 공격 역량이 많은 엔터프라이즈 네트워크 방어가 강화된 속도보다 빠르게 확장되고 있으며, 동시에 정렬 감사 점수가 개선되고 있다는 것을 보여주는 가장 명확한 최첨단 연구실 증거입니다 — 이는 이사회와 CISO가 AI 도입 및 방어 자세 계획에 고려해야 할 조합입니다.
필요한 조치
CISO와 이사회 위험 위원회에 영국 AISI 사이버 범위 발견사항을 브리핑하고 내부 네트워크 강화를 Opus 5가 극복할 수 있었던 '약한 보안 제어' 프로필과 교차 참조하십시오.