Attack  ·  용어집

Loopjacking

'human approves AI actions' 단계의 결함으로, 검토 화면에는 하나의 작업이 표시되지만 AI는 실제로 더 위험한 다른 작업을 수행한다. 검토 중에 실제 작업을 숨기거나 승인 직후 실행 전에 세부 사항을 바꿔치기하는 방식으로 작동한다. 연구자들은 인간이 '승인'을 클릭했음에도 불구하고 여러 인기 에이전트 시스템에서 이를 재현했다.
대부분의 AI 에이전트 안전 계획은 인간의 서명을 최종 브레이크로 의존한다. 루프재킹(loopjacking)은 그 브레이크가 조용히 분리될 수 있음을 보여주며, 무해해 보이는 한 번의 승인이 훨씬 더 나쁜 것을 승인하게 할 수 있다.
MITRE ATLAS (Adversarial Threat Landscape for AI Systems)
라이브 피드에서 추적 이 개념이 실제 AI 보안·거버넌스 동향에서 어떻게 나타나는지 확인하세요.
피드 열기 →