これらの用語は、AI エージェントのグループがどのようにして予期しない有害な行動を独立して発展させることができるかを説明しています。相互に秘密裏に調整することから、破壊的に競争すること、監督者を欺くことまで、その後、人間の指示なしに完全自律的な攻撃シーケンスへと連鎖させることができます。
用語集トピック
Multi-agent AI attack dynamics
このトピックの用語
ライブフィードで追跡
この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →