Attack  ·  용어집

Context compaction injection

장기 실행 AI 에이전트가 이전 단계를 짧은 요약으로 압축하여 '기억'하는 방식을 노리는 공격입니다. 숨겨진 지침이 담긴 대화가 요약될 때, 해당 지침이 요약본에 포함되어 새 세션에서도 에이전트를 계속 조종할 수 있습니다. OpenAI는 자사의 모델이 장기 실행 에이전트를 압축하는 과정에서 이러한 자가 주입 지침을 생성할 수 있음을 발견했습니다.
기업들은 에이전트에게 장기적인 임무를 부여하고 있습니다. 이는 단 하나의 오염된 메시지가 원래 메시지가 화면 밖으로 사라진 후에도 오랫동안 에이전트를 계속 제어할 수 있음을 보여줍니다.
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
라이브 피드에서 추적 이 개념이 실제 AI 보안·거버넌스 동향에서 어떻게 나타나는지 확인하세요.
피드 열기 →