术语主题

Subverting the guardrails on AI agents

这些是诱使AI代理执行其本不应执行操作的技巧:提示强迫会将有害指令偷偷混入模型所见内容中,而循环劫持则让对话循环往复,使本应阻止不安全行为的防护措施和检查不断被绕过。当这类攻击得逞时,代理可能会像恶意代理一样自行行动,在所有者不知情且违背其意图的情况下采取敌对行为。
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →