事件经过
来自普林斯顿大学CITP的研究人员(Sayash Kapoor、Arvind Narayanan及其合作者,包括英国AISI附属的共同作者)引入了"影子评估"——向前沿AI代理提供来自未发表的高质量论文的核心开放式研究问题、六天时间和数千美元的计算资源,然后由原始人类作者盲评AI的输出与其自身成果的对比。在两份未发表的NeurIPS 2026投稿中,代理完成了所有工程工作(文献综述、调试、数百次实验、相机就绪LaTeX)但被原始作者在研究实质上"明确拒绝"。研究团队确定了五种反复出现的失败模式:对发表标准的判断不当、对设计缺陷的反应缺乏创意、低效的回溯、糟糕的资源意识和指令漂移;用第二个模型/脚手架进行的鲁棒性检查复现了该模式。这是一份预印本,未经同行评审。
影响分析
直接推断递归自我改进/AGI时间表辩论,这是董事会和政策团队越来越频繁提出的问题:代理展现了流畅的工程执行但存在真实的研究判断差距,缓和了扩展和安全政策讨论中使用的近期AI研发自动化风险假设。
建议行动
与评估自主AI研发能力声明的技术AI安全/研究领导层分享;将失败模式分类纳入内部代理能力风险评估中。