Attack  ·  用語集

Prompt forcing

AIアシスタントを乗っ取る方法の一つで、読み取るコンテンツに悪意のある一文を紛れ込ませるのではなく、まったく新しい命令セットを与えるというもの。攻撃者はアシスタントの通常の会話上の防御をすり抜け、その行動を実行する基盤システムに直接話しかけるため、だましにかけるガードレールが存在しない。ブラウザでは、悪意のあるアドオン1つで組み込みのAIアシスタントにこれを静かに実行させ、ローカルファイル、メール、パスワードを掌握できる。
あなたの組織の人々がすでに信頼しているAIを密かに操れる攻撃者は、そのアシスタントが保持するすべての権限を継承します——メールの閲覧、ファイルの参照、メッセージの送信——追加のハッキングは一切不要です。
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
ライブフィードで追跡 この概念が実際のAIセキュリティ・ガバナンスの動向でどう現れるかを確認。
フィードを開く →