Attack  ·  용어집

Prompt forcing

AI 어시스턴트를 장악하는 방식으로, AI가 읽는 콘텐츠에 악성 문구 한 줄을 몰래 넣는 대신 완전히 새로운 지침 세트를 주입하는 방식이다. 공격자는 어시스턴트의 일반 대화 보호 장치를 우회하고, 그 동작을 수행하는 기반 시스템에 직접 말을 건다. 따라서 속일 가드레일이 없다. 브라우저에서는 악성 추가 기능 하나가 조용히 내장 AI 어시스턴트에 이 작업을 수행하여 로컬 파일, 이메일, 비밀번호에 대한 제어권을 얻을 수 있다.
이미 직원들이 신뢰하는 AI를 은밀히 명령할 수 있는 공격자는 해당 어시스턴트가 보유한 모든 권한을 상속받는다 — 메일 읽기, 파일 탐색, 메시지 전송 — 추가 해킹 없이도 가능하다.
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
라이브 피드에서 추적 이 개념이 실제 AI 보안·거버넌스 동향에서 어떻게 나타나는지 확인하세요.
피드 열기 →