무슨 일이 있었나
Princeton의 CITP 연구진(Sayash Kapoor, Arvind Narayanan 및 영국 AISI 계열 공동 저자 포함)은 '섀도우 평가'를 도입했습니다 — 프론티어 AI 에이전트에게 미발표 고품질 논문의 핵심 개방형 연구 질문, 6일간의 기간, 수천 달러의 계산 자원을 제공한 후 원래 인간 저자들이 자신의 결과물과 비교하여 AI의 결과물을 맹검 평가합니다. 미발표된 NeurIPS 2026 투고 2개 전반에서 에이전트는 모든 엔지니어링 작업(문헌 검토, 디버깅, 수백 개의 실험, 카메라 준비 완료 LaTeX)을 인간의 도움 없이 완료했으나 연구 실질 측면에서 원저자들로부터 '명확하게 거절'당했습니다. 팀은 5가지 반복적 실패 모드를 식별합니다: 출판 기준에 대한 판단 부족, 설계 결함에 대한 창의적이지 않은 대응, 비효율적 백트래킹, 불충분한 자원 인식, 지시 표류; 두 번째 모델/스캐폴딩을 사용한 견고성 점검이 이 패턴을 재현했습니다. 이것은 사전 인쇄본이며 동료 검토를 거치지 않았습니다.
왜 중요한가
이사회와 정책팀이 점점 더 자주 질문하는 재귀적 자가 개선/AGI 타임라인 논쟁을 직접 정보 제공합니다: 에이전트는 유창한 엔지니어링 실행을 보이지만 진정한 연구 판단 격차를 보여주며, 스케일링 및 안전 정책 논의에 사용되는 근시적 AI R&D 자동화 위험 가정을 완화합니다.
필요한 조치
자율 AI R&D 역량에 대한 주장을 평가하는 기술 AI 안전/연구 리더십과 공유하십시오; 내부 에이전트 역량 위험 평가에 실패 모드 분류를 통합하십시오.