Attack  ·  术语库

Loopjacking

“人类批准AI操作”环节存在缺陷:审核界面显示一个操作,而AI实际执行的是另一个更危险的操作。其手法是在审核期间隐藏真实操作,或在批准后、执行前迅速调换细节。研究人员已在多个主流智能体系统中复现此问题,即便人类已点击“批准”。
大多数AI智能体的安全方案都依赖人工签字作为最后一道刹车;循环劫持表明,这道刹车可能被无声地解除,因此一次看似无害的批准,就可能授权更严重的行为。
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →