전략 보고서  ·  2026-10-05

Principles for Embedded Evaluations

전략 보고서High 영향도Global
Apollo Research는 프론티어 AI 개발자에 대한 내장형 평가(embedded evaluations) 프레임워크를 발표하며, 최종 체크포인트 테스트만으로는 훈련 및 내부 배포 중에 발생하는 통제 상실 위험을 잡아낼 수 없다고 주장한다(OpenAI–Hugging Face 사건을 증거로 인용). 이 논문은 직원에 준하는 접근 권한을 가진 평가자가 개발자의 안전 주장을 검증하거나 반증하는 주장 기반 설계를 제안하며, 효과적인 내장형 평가가 반드시 충족해야 할 네 가지 기준을 정의한다: '위험 감소, 대중에 정보 제공, 좋은 인센티브, 양측에 공정.' 또한 평가자는 모든 훈련 데이터, 롤아웃, 체크포인트, 내부 배포 세부사항에 지속적으로 접근해야 하며, 기본적으로 공개를 원칙으로 하되 삭제(redaction)에 대해 메타 투명성을 확보하고, 심각한 발견 사항(예: 모델이 가중치를 외부 서버로 복사하려는 시도)은 사전 합의된 짧은 기간 내에 공개해야 한다고 주장한다. 이 프레임워크는 다른 고위험 산업에서의 독립 감사에 대한 기존 관행을 기반으로 하며, 개발자와 평가자가 채택할 수 있는 최소한의 출발점으로 설계되었다.
내장형 평가는 프론티어 연구소들이 2026년 9월 페이싱(pacing) 약속에서 서명한 메커니즘이며, 이는 '직원 수준 접근'이 실제로 무엇을 제공해야 하는지에 대한 최초의 구체적이고 실행 가능한 설계 중 하나이다 — 제3자 AI 보증을 협상하거나 새로운 내장형 평가자 체제에 대비하는 모든 조직에 직접적으로 관련된다.
네 가지 기준과 주장 기반 접근 요구사항을 작성 중이거나 서명할 제3자 AI 평가 조항에 대응시켜, 접근 조항이 독립 평가자가 필요하다고 주장하는 수준과 일치하도록 하라.
Apollo Research — Principles for Embedded Evaluations
라이브 피드에서 보기 AI 보안 및 거버넌스 관련 소식을 더 살펴보세요 — 매일 아침 업데이트.
피드 열기 →