事件经过
约2026年9月23日,CETaS(新兴技术与安全中心,英国艾伦·图灵研究所的一部分)发表了Rick Hennessy教授和Carolyn Ashurst博士撰写的一篇论文,提出了一种代理AI行为保障的社会技术框架。该论文引入了涵盖单个代理、多代理系统和人与代理交互的行为失效模式分类法,将访问权限/授权/信任确定为将代理行为转化为组织危害的三个因素,并提出了七项行为保障原则。一份详细的操作报告被标记为即将发布。
影响分析
这是英国国家研究所项目中的首份出版物,为敏感/高风险组织(政府、关键部门)提供了一种超越模型评估的代理行为保障词汇表——补充了“代理行动但开发者发现较晚”的事件模式,并融入英国保障和治理框架。
建议行动
高风险英国/受监管环境中的CISO和AI治理团队在界定代理AI监督和干预控制范围时,应使用失效模式分类法以及访问权限/授权/信任视角。