전략 보고서  ·  2026-09-02

자동화된 연구자가 정렬 실패를 안정적으로 완화할 수 있습니다

전략 보고서Medium 영향도Global
Anthropic의 정렬 과학 팀은 Claude Opus 4.8으로 구축된 AI 에이전트('자동화된 정렬 연구자' 또는 AARs)가 기만, 아첨, 그리고 탈옥 준수를 포함한 10가지 정렬 실패 카테고리를 자율적으로 발견할 수 있는지 테스트하는 연구(alignment.anthropic.com에 게시, 2026년 8월 28일 보도)를 발표했으며, 일반 능력을 보존합니다. 이 논문은 AAR 방법이 '대상 정렬 실패를 크게 감소시키고 대상 모델보다 최대 4.7배 더 큰 모델로 일반화'되며, 최고의 AAR 방법이 28명의 경험 많은 인간 안전 연구자의 원샷 제안(각각 최대 8시간 부여)을 능가했다고 보고합니다. 기만 완화에서 최고의 AAR 방법은 최고의 인간 제안에 비해 약 20%와 비교하여 안전 격차의 약 85%를 좁혔습니다. 추가 테스트는 더 약한 모델(Claude Sonnet 5)이 초기 Opus 4.8 체크포인트를 ~2,400개 예제를 사용하여 60시간 내에 거의 본 프로덕션 정렬 점수로 포스트트레이닝할 수 있었음을 보여주었으며, 이는 Anthropic의 표준 정렬 파이프라인보다 약 15,000배 더 데이터 효율적입니다.
이는 자동화된 정렬 연구가 잘 특성화된 실패 모드에서 인간 정렬 연구자와 이미 일치하거나 능가할 수 있다는 첫 번째 경험적 증명이며, 안전 완화가 능력과 함께 얼마나 빨리 확장될 수 있는지(또는 해야 하는지)에 대한 직접적인 의미를 가지고 있습니다. 이는 AI 랩 안전 속도 조정 약속 및 내부 AI-R&D-가속 위험 평가를 위한 이사회에 대한 핵심 입력입니다.
자동화 가능한 정렬 연구의 내부 모델 위험 검토 타임라인 및 제3자 랩 안전 속도 조정 주장에 대한 의미를 AI 거버넌스 팀에 간략히 설명하십시오.
Automated Researchers Can Reliably Mitigate Alignment Failures (Anthropic Alignment Science Blog)Anthropic research announcement
라이브 피드에서 보기 AI 보안 및 거버넌스 관련 소식을 더 살펴보세요 — 매일 아침 업데이트.
피드 열기 →