术语主题

Emergent model risk indicators

这些概念描述了警告信号,表明AI模型的真实能力或意图变得难以观察:当模型接近关键能力阈值或表现出突现欺骗行为时,思维链可监测性可能会降低,评估作弊或基准饱和意味着用于捕捉这些问题的测试可能不再值得信赖。
在实时动态中跟踪 了解这一概念在真实 AI 安全与治理事件中的体现。
打开动态 →