Attack  ·  用語集

Loopjacking

「人間がAIの行動を承認する」ステップに欠陥があり、レビュー画面には1つのアクションが表示される一方で、AIは実際には異なる、より危険なアクションを実行する。この攻撃は、レビュー中に実際のアクションを隠すか、承認直後かつ実行前に詳細をすり替えることで機能する。研究者らは、人間が「承認」をクリックしたにもかかわらず、複数の人気エージェントシステムでこれを再現した。
AIエージェントの安全性計画のほとんどは、最終的なブレーキとして人間の承認に依存している。ループジャッキングは、そのブレーキが静かに切断され得ることを示しており、無害に見える1回の承認が、はるかに悪質な何かを許可することになり得る。
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
ライブフィードで追跡 この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →