취약점  ·  2026-10-07

vLLM EngineCore DoS / 캐시-포이즈닝 클러스터 — 인증된 호출자가 공유 LLM 서빙 엔진을 충돌시킬 수 있음

취약점Medium 영향도GlobalCVE-2026-105754
10월 5일에 게시된 vLLM 권고 배치(0.28.0/0.30.0에서 수정): 멀티모달-미러 LRU 캐시는 엔진 입장 전에 미디어 해시를 커밋하므로 거부된 요청은 캐시를 비동기화시키고 이후 요청은 어설션에 도달합니다(105753). 분리된 /inference/v1/generate 엔드포인트는 호출자 제공 텐서/해시/플레이스홀더를 수락하여 공유 EngineCore를 종료하고 교차 요청 인코더-캐시 상태를 오염시키거나 검색할 수 있습니다(105754). 잘못된 cache_salt는 LMCache-MP 조회에서 포착되지 않은 ValueError를 발생시킬 수 있습니다(105756). 구조화된 출력 실패는 EngineCore 치명적 경로에 도달합니다(105757). 인증되지 않은 임의 HTTP 메서드 토큰은 메모리가 소진될 때까지 Prometheus 레이블 세트를 증가시킵니다(105759). 그리고 /score, /rerank는 호출자 제어 X-Request-Id 헤더에서 query_key를 파생하여 쿼리 임베딩 덮어쓰기를 가능하게 합니다(105755).
vLLM은 가장 널리 배포된 오픈소스 LLM 서빙 백엔드 중 하나입니다. 이러한 취약점은 일반 API 호출자(프론트/백엔드 모드 또는 OpenAI 호환 엔드포인트)가 도달할 수 있으며, 각각 단일 낮은 권한 또는 인증되지 않은 요청이 공유 EngineCore를 종료할 수 있습니다 — 단일 요청으로 공유 가능성 중단 — 또는 서빙 노드를 공유하는 다른 테넌트에 영향을 주는 캐시 상태를 손상시킬 수 있습니다.
서빙 엔드포인트에 조작된 멀티모달/제한된 생성 요청, 잘못된 cache_salt 값 또는 반복되는 고유 HTTP 메서드 토큰을 보내 어설션/엔진 종료 또는 무제한 메트릭 증가를 트리거합니다.
vLLM < 0.28.0 (CVE-2026-105753 미러-캐시 어설션); < 0.30.0 (CVE-2026-105754 /inference/v1/generate EngineCore 종료 + 인코더-캐시 포이즈닝; CVE-2026-105756 LMCache-MP cache_salt 충돌; CVE-2026-105757 구조화된 출력 치명적 경로; CVE-2026-105759 Prometheus 레이블 메모리 소진; CVE-2026-105755 /score, /rerank X-Request-Id 캐시 덮어쓰기)
vLLM 0.28.0(105753) 및 0.30.0(105754/105756/105757/105759/105755)으로 업그레이드합니다. 요청 수준 미디어/캐시 인자를 제한하고 가능한 경우 /metrics를 속도 제한합니다.
NVD CVE-2026-105754GitHub advisory GHSA-ph72-cqr5-qpp7NVD CVE-2026-105753NVD CVE-2026-105759
라이브 피드에서 보기 AI 보안 및 거버넌스 관련 소식을 더 살펴보세요 — 매일 아침 업데이트.
피드 열기 →