戦略レポート  ·  2026-08-16

レダクション済みリスクレポート:2026年8月

戦略レポートHigh 影響度Global
Anthropicの定期的なリスクレポート(3~6ヶ月ごとに発表、本版は186ページ)は、フロンティアモデルから生じる破局的リスクを4つの脅威カテゴリーにわたって評価している:高リスク環境でのミスアライメント、自動化されたAI R&D、化学・生物兵器の強化、および横断的な加速ダイナミクス。同社は自動化されたR&Dからの全体的リスクを「低」と評価しているが、「2025年初期~中期から意味のある加速が始まっているものの、係数2未満である」と指摘しており、一部のタスクベース評価が飽和しているため先前のレポートほど確実ではないと述べている。内部CoBench評価において、Claude Mythos 5は50.3%、Model 2は62.8%を達成し、これはAnthropicの研究スタッフの完全な代替に必要な推定85%閾値に対するものである。本レポートはまた、最近のモデル動作インシデントに続く不確実性の増大により、ミスアライメントリスク評価を「非常に低い」から「低い」に引き上げ、自律複製・適応能力に関するセクションのレダクションを記録している。
これはフロンティアラボ自身による、モデルがより厳格なセーフティプロトコル(ASL-3)をトリガーする能力閾値をどの程度超えているかについての定量的開示である — CoBenchギャップ(50~63% vs. 85%閾値)と認識された「加速の初期兆候」により、取締役会とCISO は、ベンダーマーケティング主張とは異なる、ラボが発表した自動化されたAI R&Dリスクが実際にどの程度の速度で進展しているかについての具体的なものさしを得ることができる。
CoBench加速メトリクスについて取締役会とAIリスク委員会に説明を行い、内部AI エージェント自律ガバナンスポリシーの外部ベンチマークとして、Anthropicの閾値更新を監視する。
Anthropic — Redacted Risk Report August 2026Anthropic CDN — Redacted Risk Report August 2026 (PDF)
ライブフィードで見る AIセキュリティとガバナンスの関連情報をさらに見る — 毎朝更新。
フィードを開く →