정의
장기 실행 AI 에이전트가 이전 단계를 짧은 요약으로 압축하여 '기억'하는 방식을 노리는 공격입니다. 숨겨진 지침이 담긴 대화가 요약될 때, 해당 지침이 요약본에 포함되어 새 세션에서도 에이전트를 계속 조종할 수 있습니다. OpenAI는 자사의 모델이 장기 실행 에이전트를 압축하는 과정에서 이러한 자가 주입 지침을 생성할 수 있음을 발견했습니다.
왜 중요한가
기업들은 에이전트에게 장기적인 임무를 부여하고 있습니다. 이는 단 하나의 오염된 메시지가 원래 메시지가 화면 밖으로 사라진 후에도 오랫동안 에이전트를 계속 제어할 수 있음을 보여줍니다.