戦略レポート  ·  2026-07-22

AI セーフティ閾値の調和

戦略レポートMedium 影響度Global
このプレプリント(査読なし)は、最先端 AI セーフティフレームワーク全体で共通の最小能力閾値を導き出すための方法論を展開し、「最先端 AI 企業が公開した能力閾値が大幅に異なり、第三者が閾値を超えたかどうかを確認したり、企業全体の要件を比較したりすることが困難である」という問題に対処しています。悪用リスク(サイバーおよび生物学的)に対して、著者らはリスク経路と公開条件全体の予想される害に基づいた明示的なリスクモデリングアプローチを使用します。自動化された AI R&D に対しては、予想される害ではなく観測された AI 進行の速度に基づいて閾値を設定することを提案しています。論文は、その推奨事項を Seoul Frontier AI Safety Commitments およびEU AI Act と California SB-53 を含む新興法制に明示的に関連付けています。
最先端隣接 AI 投資を監督する取締役会および Seoul Commitments を追跡するポリシーチームは、これをラボセーフティフレームワークの第三者監査のための信頼できる技術的基盤として注視すべきです — これは潜在的な規制調和要件の前兆です。
ポリシーおよびセーフティチームは、内部能力閾値定義(該当する場合)を提案された調和された最低基準と比較し、規制採用を監視すべきです。
arXiv: Harmonizing AI Safety Thresholds
ライブフィードで見る AIセキュリティとガバナンスの関連情報をさらに見る — 毎朝更新。
フィードを開く →