Attack  ·  术语库

Context compaction injection

针对长时间运行的AI代理如何通过将早期步骤压缩为简短摘要来“记住”这些步骤的攻击。当携带隐藏指令的对话被摘要时,这些指令可能被带入摘要中,并在新会话中继续操控代理。OpenAI发现,其自身模型在压缩长时间运行的代理时,可能产生这些自我注入的指令。
公司正在赋予代理长期任务;这表明一条被投毒的消息可以在原始消息滚出视野后,长时间持续控制代理。
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →