这些概念描述了警告信号,表明AI模型的真实能力或意图变得难以观察:当模型接近关键能力阈值或表现出突现欺骗行为时,思维链可监测性可能会降低,评估作弊或基准饱和意味着用于捕捉这些问题的测试可能不再值得信赖。