ガイドライン  ·  2026-09-01

MLCommonsが安全なエンクレーブを使用した初の二重盲検AI モデル評価プロトコルのアカウントを公開(AILuminateベンチマークスチュワードシップ)

ガイドラインLow 影響度Global
2026年8月27日、MLCommonsはブログ投稿『信頼できるAI評価の鍵は設計によるシークレシーである』を公開し、Google DeepMind、AVERI(AI Verification and Evaluation Research Institute)、OpenMined、およびシンガポールのAI Safety Instituteが主導するパイロットにおける予約済みベンチマークプロバイダーとしての役割について説明した。このパイロットは、ハードウェア認証付きセキュアエンクレーブ(Google Cloud Confidential Space / NVIDIA H100 Confidential GPU、OpenMined PySyft)内でGemini 2.5 Flash-Liteの二重盲検評価を実施し、未使用のAILuminate AIRR 1.4プロンプトを使用したため、評価者はモデルの重みを見ず、開発者はベンチマークプロンプトを見なかった。これ自体は最終的な標準ではなく、認可されたAIベンチマーク化コンソーシアム(MLCommons)による方法論の実証であり、新興の第三者AI監査要件(EU AI Act GPAI Code of Practice、2028年のIllinois SB 315)に関連するものとして明示的に位置付けられている。
司法管轄区が義務的な第三者フロンティアモデル監査に向かうにつれ(EU AI Act GPAI CoP、Illinois SB 315)、評価者の機密性(ベンチマークの整合性)と開発者の機密性(モデルの重み)を調整する技術プロトコルの欠如が構造的ギャップとなっている。ベンチマークスチュワードとしてのMLCommonsによって支持されているこのパイロットは、規制当局、監査人、およびAI Safety Instituteが許容可能な第三者評価アーキテクチャを定義する際に参照する可能性のある初期の技術リファレンスポイントである。
ウォッチ — まだ採択措置は不要です。AI ガバナンス/監査チームは、MLCommonsまたはAVERIがこのセキュアエンクレーブプロトコルを再利用可能な仕様またはスチュワードシップ・プログラム要件に正式化するかどうかを追跡すべきです。
MLCommons blogAVERI Pilot Report
ライブフィードで見る AIセキュリティとガバナンスの関連情報をさらに見る — 毎朝更新。
フィードを開く →