指南  ·  2026-09-28

敏感和高风险组织的代理AI行为保障(CETaS研究论文)

指南Medium 影响Global
约2026年9月23日,CETaS(新兴技术与安全中心,英国艾伦·图灵研究所的一部分)发表了Rick Hennessy教授和Carolyn Ashurst博士撰写的一篇论文,提出了一种代理AI行为保障的社会技术框架。该论文引入了涵盖单个代理、多代理系统和人与代理交互的行为失效模式分类法,将访问权限/授权/信任确定为将代理行为转化为组织危害的三个因素,并提出了七项行为保障原则。一份详细的操作报告被标记为即将发布。
这是英国国家研究所项目中的首份出版物,为敏感/高风险组织(政府、关键部门)提供了一种超越模型评估的代理行为保障词汇表——补充了“代理行动但开发者发现较晚”的事件模式,并融入英国保障和治理框架。
高风险英国/受监管环境中的CISO和AI治理团队在界定代理AI监督和干预控制范围时,应使用失效模式分类法以及访问权限/授权/信任视角。
CETaS publication pageThe Alan Turing Institute blog — How can obedient agents behave badly?
在实时动态中查看 浏览更多 AI 安全与治理相关发现 — 每日清晨更新。
打开动态 →