何が起きたか
Apollo Researchは、フロンティアAI開発者に対する組み込み型評価のフレームワークを発表し、最終チェックポイントでのテストでは、トレーニング中および内部展開中に発生する制御喪失リスクを捕捉できないと主張している(証拠としてOpenAI–Hugging Face事件を引用)。この論文は、従業員と同等のアクセス権を持つ評価者が開発者の安全性に関する主張を検証または反証する、クレームベースの設計を提案し、効果的な組み込み型評価が満たさなければならない4つの基準を定義している:「リスクを低減する、国民に情報提供する、適切なインセンティブを与える、双方に公正である」。また、評価者はすべてのトレーニングデータ、ロールアウト、チェックポイント、内部展開の詳細への継続的なアクセスが必要であり、デフォルトで公開し、編集についてはメタ透明性を確保し、重大な発見(例えば、モデルが自身の重みを外部サーバーにコピーしようとする試み)については、事前に合意した短期間内に開示すべきだと論じている。このフレームワークは、他の高リスク産業における独立監査の確立された実践に基づいており、開発者と評価者が採用するための最小限の出発点として意図されている。
なぜ重要か
組み込み型評価は、2026年9月のペーシング公約でフロンティアラボが署名したメカニズムであり、これは「従業員のようなアクセス」が実際に何を提供すべきかについての、最初の具体的かつ実装可能な設計の一つである。第三者AI保証を交渉している組織や、 emerging 組み込み評価者体制に備えている組織に直接関連する。
必要な対応
あなたが作成または署名している第三者AI評価条項に対して、4つの基準とクレームベースのアクセス要件をマッピングし、アクセス条項が独立評価者が必要と主張するものと一致するようにすること。