다음은 AI 에이전트가 하지 말아야 할 일을 하게 만드는 트릭들입니다: 프롬프트 포싱은 모델이 보는 내용에 해로운 지시를 몰래 주입하고, 루프재킹은 대화를 순환시켜 안전하지 않은 행동을 막기 위한 가드레일과 검사가 계속 우회되도록 합니다. 이러한 공격 중 하나가 성공하면, 에이전트는 스스로 로그 에이전트처럼 행동하며 소유자의 의도 밖에서 그리고 인지 없이 적대적 행동을 취할 수 있습니다.
용어집 주제
Subverting the guardrails on AI agents
라이브 피드에서 추적
이 개념이 실제 AI 보안·거버넌스 동향에서 어떻게 나타나는지 확인하세요.
피드 열기 →