何が起きたか
ELLIS Institute Tübingen、Max Planck Institute、MATS Research、および Snyk からの合同研究チームが「Stealing Reasoning Traces from Proprietary LLM APIs」(arXiv 2608.09867) を公開し、OpenAI、Anthropic、および Google が暗号化された思考チェーン隠蔽をどのように実装しているかのアーキテクチャの欠陥を開示しました。これにより、3 つのプロバイダーのすべての推論モデルエコシステム全体にわたってスケーラブルな復号化ジェイルブレイクが可能になります。
なぜ重要か
これは 3 つの最大規模のフロンティアモデル API ベンダーに同時に影響する新規のクロスプロバイダー攻撃クラスです。単一ベンダーのバグではありません。プロプライエタリ推論トレースの知的財産保護を回避し、公開リポジトリからの実世界の漏洩 PII/認証情報をスケール規模で公開し、可視出力が保留するように設計された危険な情報を表面化でき、公開エージェンティックデータセットへの目に見えないプロンプトインジェクションのチャネルを作成します。プロバイダーは数ヶ月前に開示を受け取ったが、これを再現可能/実行可能として扱いませんでした。
攻撃経路
推論モデル API によって返される暗号化された推論ブロックは、プロバイダーのエコシステム内のセッション、ユーザー、およびモデル全体で完全に互換/交換可能です。攻撃者は、より強力でよく保護されたモデルからキャプチャされた暗号化された推論トレースを、同じプロバイダーからのより弱く、保護の少ないシブリングモデルに注入します。より弱いモデルはトレースをデコードして平文で逐語的に出力し、より強いモデルを直接ジェイルブレイクすることなく。実証された攻撃ベクトルには、反蒸留バイパス、公開共有されたセッションログからの大規模な PII/認証情報抽出(スクレイプされた推論ブロック 315,320 個から 367 個の PII アーティファクトおよび 182 個の認証情報が回復)、最終出力が拒否しても推論に隠された危険な情報の開示、および公開エージェンティックロールアウトを汚染するために完全に暗号化ブロック内に埋め込まれた目に見えないプロンプトインジェクションが含まれます。
影響を受けるシステム
OpenAI GPT-5.6 API、Anthropic Claude Opus 4.8 API、Google Gemini 3 API(暗号化/不透明思考チェーン推論ブロックアーキテクチャ)
緩和策
研究者は責任を持ってプロバイダーに開示し、暗号化/システムレベルの緩和策を提案しています(例:推論ブロックをセッション/ユーザー/モデルアイデンティティにバインディング、クロスモデル再生を無効化)。開示時点では公開ベンダーパッチが確認されていません。セッションログを公開共有している組織は、暗号化された推論ブロックを機密として扱い、編集する必要があります。