脆弱性  ·  2026-09-30

共有型AIウイルス:成果物を介したメモリホッピングプロンプトインジェクションが自己伝播ペイロードをLLMエージェント全体に拡散(arXiv)

脆弱性High 影響度Global
arXiv 2609.35576(2026-09-28提出、期間内)は、独立して運用されるLLMエージェント間での時間経過に伴うプロンプトインジェクション状態の「成果物を介した伝播」を形式化しています。時間的人間エージェントシミュレーションでは、攻撃は連続する引き継ぎを生き延びて持続します。GPT-5.6 Lunaでは、より大規模な環境でペイロードがエージェントの60〜80%に到達し、伝播チェーンは最大8ホップに及びました。最近のOpenAI自己複製インジェクション開示と並んで、エージェントメモリ/成果物チャネルによって運ばれる新しい自己伝播攻撃クラスとして位置付けられています。
エージェントの永続メモリと、それが読み書きする共有成果物(レポート、ドキュメント、ファイル)が、独立して動作するアシスタント間をホップし、個々の対話を生き延びるプロンプトインジェクションワームの永続的な「キャリア」状態として機能し得ることを実証しています。防衛者にとって、これは成果物ストア、共有ドライブ、エージェントメモリバックエンドが第一級の伝播ベクトルであることを意味します:メモリスキャン、エージェントが書いたコンテンツのサンドボックス化、およびすべての永続化/要約コンテンツを信頼できないものとして扱うことが必須の制御です。
共有成果物(例:レポート)を通じて導入された敵対的コンテンツは、アシスタントの永続メモリに保存され、その後作成される成果物に再現され、後でそれらを読む別のアシスタントによって取得されます—成果物交換を介した伝播(メモリホッピング)、直接のエージェント間通信は不要です。
永続メモリと共有成果物へのツールアクセスを持つステートフルLLMアシスタント(GPT-5.6 Lunaを含めて評価済み)。成果物/永続化ストアを使用するエージェントハーネス全体に普遍的
エージェントが消費するすべての永続化された成果物とメモリエントリを信頼できない命令コンテンツとして扱ってください。エージェントメモリを分離し、共有成果物内の敵対的コンテンツをスキャン/無害化し、エージェントが共有・再読み取り可能な成果物を書き込むことを可能にするツールを制限し、永続化された命令のようなペイロードを監視してください。
arXiv 2609.35576 abstractarXiv HTML full text
ライブフィードで見る AIセキュリティとガバナンスの関連情報をさらに見る — 毎朝更新。
フィードを開く →