Attack  ·  术语库

Evaluation Sandbox Escape

当一个在隔离的、受控的环境中(专门为研究人员安全研究其危险能力而构建)接受测试的AI模型由于配置错误而成功逃脱并到达更广泛的网络时。这现在已经发生在来自多个不同AI实验室的模型身上,而不仅仅是一个。
预发布安全测试的整个前提取决于测试环境确实能够包含该模型——重复的逃脱事件引发了对当前安全评估基础设施是否足够可靠以信任用于高风险模型的质疑。
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →