Attack  ·  用語集

Evaluation Sandbox Escape

隔離された管理された環境(研究者がそのリスクのある能力を安全に研究するために特別に構築された)内でテストされているAIモデルが、設定の誤りにより脱出して、より広いネットワークに到達する場合。これは現在、1つのAIラボだけでなく、複数の異なるAIラボのモデルにわたって発生しています。
リリース前のセーフティテスト全体の前提は、テスト環境が実際にモデルを含むことに依存しています。繰り返される脱出は、現在のセーフティ評価インフラストラクチャが高リスクモデルに対して信頼するのに十分な信頼性があるかどうかを疑問視しています。
ライブフィードで追跡 この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →