定义 一种越狱技术,攻击者将恶意指令隐藏在加密或编码的有效负载中,使得AI模型的安全过滤器(通常扫描纯文本)在解密和执行前永远看不到有害内容。已被证明能够在不需要用户点击的情况下击败主要聊天机器人的输入和输出安全检查。 影响分析这证明了当今的安全护栏可以通过可重复的技巧系统地被绕过,而不是一次性的漏洞,这意味着任何使用类似过滤机制的AI产品都需要针对这类攻击重新测试。