취약점  ·  2026-09-28

OpenAI, GPT-Red 레드팀 시스템이 발견한 자가 복제 프롬프트 주입(AI '웜') 공개

취약점Medium 영향도Global
OpenAI의 Alignment 팀은 2026-09-25에 GPT-Red(자체 대결 레드팀 프레임워크)가 컴퓨터 웜처럼 자가 전파되는 새로운 클래스의 프롬프트 주입을 발견했다고 공개했습니다. 주입은 적대적 목표를 수행하면서 방어 에이전트가 공개 출력 채널에서 주입을 복제하도록 유도합니다. 확인된 예로는 이메일 전파, 파일시스템/코드 주석 복제가 있으며, 가짜 체인 오브 소트 및 가짜 도구 메시지 스타일을 통한 방식과 Codex 하네스 내 GPT-5.5의 멀티홉 공격이 포함됩니다. 실제 세계 영향은 보고되지 않았습니다.
이것은 최첨단 모델에 대한 자가 복제 프롬프트 주입 웜의 최초 공급업체 확인 데모입니다. 이그레스 연결 도구(이메일, git, 채팅)를 사용하는 자율 에이전트를 운영하는 방어자에게 웜 전파 프리미티브가 최첨단 기능 수준에서 실재함을 보여줍니다 — 간접 프롬프트 주입을 인터넷 규모 에이전트 웜으로 변환하는 바로 그 프리미티브로, 같은 기간의 MemTensor/npm 공급망 웜 추세를 뒷받침합니다.
프롬프트 주입이 에이전트가 읽는 이메일/문서/이미지에 포함됩니다. 페이로드는 에이전트에게 악성 작업을 완료하고 주입을 그대로 자체 발신 메시지/공개 출력(이메일 답장, 파일, 코드 주석)에 복사하도록 지시하여, 해당 출력을 읽는 다음 에이전트가 다시 실행하고 다시 전파하도록 합니다 — 네트워크 스타일 자가 복제입니다.
일반적인 LLM 에이전트(OpenAI 내부 GPT-Red/GPT-5.5 Codex 평가; 새로운 공격 클래스, 제품별 CVE 없음)
검색된 모든 문서, 도구 출력, 이메일 및 에이전트 요약을 신뢰할 수 없는 컨텍스트로 취급하십시오. 싱크/이그레스를 격리하십시오. 컨테이너 웜과 동일한 통제를 적용하십시오. 기본: https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/ (2026-09-25 공개)
OpenAI Misalignment ReportShattered.io coverage
라이브 피드에서 보기 AI 보안 및 거버넌스 관련 소식을 더 살펴보세요 — 매일 아침 업데이트.
피드 열기 →