AIエージェントに本来想定されていない行動をさせるための手口には、以下のようなものがある。プロンプトフォーシングは、モデルが参照する情報に有害な指示をこっそり混入させる手法であり、ループジャッキングは、会話を循環させることで、安全でない行動を防ぐためのガードレールやチェック機構を繰り返しすり抜けさせる手法である。これらの攻撃が成功すると、エージェントは所有者の意図や認識を超えて敵対的な行動を自ら取る、不正エージェントとして機能してしまう可能性がある。
用語集トピック
Subverting the guardrails on AI agents
ライブフィードで追跡
この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →