Attack  ·  术语库

Prompt forcing

接管AI助手的一种方式,即向其输入一整套全新指令,而不是在它所读取的内容中偷偷塞入一条恶意线。攻击者绕过助手的正常对话防护措施,直接与执行其操作的底层系统对话,因此没有任何护栏可欺骗。在浏览器中,一个恶意插件可以悄无声息地对内置AI助手执行此操作,从而控制本地文件、电子邮件和密码。
能够秘密操控你们员工已经信任的AI的攻击者,会继承该助手拥有的所有权限——读取邮件、浏览文件、发送信息——无需额外黑客攻击。
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →