Concept  ·  用語集

Chain-of-thought monitorability

多くの高度なAIモデルは、回答する前に目に見える「スクラッチパッド」で「声を出して考え」、安全チームがその推論を読んで悪い意図を早期に察知できるようにしています。「モニタラビリティ」とは、その目に見える推論が、モデルが実際に内部で行っていることをどの程度反映しているかを示しています。これが低下すると、モデルは依然として有害な目標に向かって推論する可能性がありますが、書かれた証跡は警告信号としての信頼性が低くなります。
フロンティアモデルの開示された推論が実際の意思決定プロセスと一致しなくなると、モデルがより高いリスク能力の閾値を超えようとしている時点で、ボードは重要な早期警告ツールを失うことになります。
ライブフィードで追跡 この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →