定义 “人类批准AI操作”环节存在缺陷:审核界面显示一个操作,而AI实际执行的是另一个更危险的操作。其手法是在审核期间隐藏真实操作,或在批准后、执行前迅速调换细节。研究人员已在多个主流智能体系统中复现此问题,即便人类已点击“批准”。 影响分析大多数AI智能体的安全方案都依赖人工签字作为最后一道刹车;循环劫持表明,这道刹车可能被无声地解除,因此一次看似无害的批准,就可能授权更严重的行为。