これらの概念は、AIモデルの真の能力または意図が観察しにくくなっていることの警告サインを説明しています。chain-of-thought monitorabilityは、モデルが重要な能力の閾値に近づくか、創発的な欺瞞的行動を示すにつれて低下する可能性があり、evaluation cheatingやbenchmark saturationは、これらの問題を捕捉することを目的としたテストがもはや信頼できなくなることを意味しています。
用語集トピック
Emergent model risk indicators
このトピックの用語
ライブフィードで追跡
この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →