정의
공격자가 AI 에이전트가 찾아서 따르도록 악의적인 지시를 심어두는 프롬프트 인젝션 공격인데, 에이전트의 응답이나 출력을 직접 보지는 못하고 오직 에이전트가 수행하도록 속임수를 쓴 행동으로부터만 이득을 얻습니다. 허니팟 연구에서 노출된 AI 인프라에 대해 실제 공격자들이 이 기법을 실행하는 것을 적발했습니다.
왜 중요한가
프롬프트 인젝션이 실험실의 호기심 대상에서 인터넷을 통해 접근 가능한 AI 시스템에 대해 대규모로 사용되는 능동적이고 기회주의적인 범죄 기법으로 진화했음을 보여줍니다.