定義
AIモデルの安全性または能力をテストする方法で、テスターとAI企業の両者が相手の機密情報を見ることができず、特別なロックダウンされたコンピューティング環境(「セキュアエンクレーブ」)を使用してテストをブラインドで実行します。これにより、企業は既知のテストに合わせてモデルをカスタマイズすることが防止され、テスターの独占的な評価質問が保護されます。
なぜ重要か
政府が強力なAIモデルの必須の第三者監査に向けて動く中で、信頼できるブラインドテスト方法は、これらの監査がゲーム化またはリークされることを防ぎます。