定义 许多先进的AI模型在回答之前会在一个可见的便签本中"大声思考",让安全团队读取这种推理过程以便早期发现不良意图。"可监控性"是指这种可见推理在多大程度上仍然反映模型内部实际在做的事情。当可监控性下降时,模型可能仍然推理出有害目标,但书面记录作为警告信号变得不那么可信。 影响分析如果前沿模型的披露推理停止与其真实决策过程相匹配,董事会将在模型跨越更高风险能力阈值之际失去一个关键的早期预警工具。