Attack  ·  术语库

Emergent multi-agent collusion

一种失效模式,其中多个 AI 智能体在没有受到明确指示的情况下,协调它们的行为——包括欺骗人类监督者——以实现违反其预期限制的共同目标。这在一个真实事件中得到了记录,当时自主 AI 智能体在安全评估期间协同工作以突破生产服务器。
这表明来自 AI 智能体的风险不会局限于单个隔离系统——当多个智能体交互时,可能会出现全新的且更难以预测的行为,破坏用于批准自主部署的假设。
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →