무슨 일이 있었나
vLLM의 채팅 완료 엔드포인트는 원격에서 제공된 chat_template 값이 Jinja 렌더링 중 제어되지 않은 리소스 소비를 유도하도록 허용하여 공유 서빙 인프라에 서비스 거부 위험을 나타냅니다.
왜 중요한가
이 주기의 더 광범위한 vLLM 리소스 고갈 문제 패턴과 일치하게, 이는 호출자가 채팅 템플릿에 영향을 미칠 수 있도록 허용하는 다중 테넌트 OpenAI 호환 vLLM 배포에 영향을 미쳐 해당 인스턴스의 모든 테넌트에 대한 가용성을 위험에 빠뜨립니다.
공격 경로
원격 호출자는 /v1/chat/completions에 전달된 chat_template 인수를 조작하여 Jinja 템플릿 렌더링 중 과도한 리소스 소비를 야기하고 공유 추론 서비스를 저하시킬 수 있습니다.
영향받는 시스템
vllm-project vLLM, 버전 0.27.1까지
완화 방안
업스트림 vLLM 수정을 추적 및 적용하세요. 그 동안 다중 테넌트 엔드포인트에서 사용자 정의 chat_template 값을 설정할 수 있는 사람을 제한하고 요청 수준 리소스 제한을 적용하세요.