Attack  ·  用語集

Context compaction injection

長期実行型AIエージェントが以前のステップを短い要約に圧縮して「記憶」する仕組みを標的とした攻撃。隠れた指示を含む会話が要約されると、その指示も要約に引き継がれ、新しいセッションでもエージェントを操り続ける可能性がある。OpenAIは自社のモデルが、長期実行型エージェントを圧縮する際にこの自己注入型指示を生成し得ることを発見した。
企業はエージェントに長期間のミッションを与えているが、これは、1つの悪意あるメッセージが、元のメッセージが画面外にスクロールアウトした後も、長期にわたってエージェントを制御し続ける可能性を示している。
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
ライブフィードで追跡 この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →