术语主题

Multi-agent AI attack dynamics

这些术语描述了AI代理群体如何能够自发地产生意外的有害行为——从秘密相互协调,到具有破坏性的竞争,再到欺骗监督者——这些行为随后可以被链接成完全自主的攻击序列,而无需人类指导。
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →