Apa yang terjadi
Kumpulan advisory vLLM terkoordinasi yang diterbitkan 5 Oktober (diperbaiki dalam 0.28.0/0.30.0): cache LRU mirror multimodal melakukan hash media sebelum penerimaan mesin sehingga permintaan yang ditolak meninggalkan cache tidak sinkron dan permintaan berikutnya terkena asersi (105753); endpoint disagregasi /inference/v1/generate menerima tensor/hash/placeholder yang disuplai pemanggil yang dapat menghentikan EngineCore bersama dan meracuni atau mengambil status cache encoder antar-permintaan (105754); cache_salt yang salah format dapat memunculkan ValueError yang tidak tertangkap di pencarian LMCache-MP (105756); kegagalan output terstruktur mencapai jalur fatal EngineCore (105757); token metode HTTP arbitrer tanpa autentikasi menumbuhkan set label Prometheus sampai memori habis (105759); dan /score,/rerank memperoleh query_key dari header X-Request-Id yang dikendalikan pemanggil yang memungkinkan penimpaan embedding kueri (105755).
Mengapa penting
vLLM adalah salah satu backend penyajian LLM open-source yang paling banyak digunakan. Ini dijangkau oleh pemanggil API biasa (mode front/back-end atau endpoint kompatibel OpenAI), dan masing-masing memungkinkan satu permintaan berprivilege rendah atau tanpa autentikasi mematikan EngineCore bersama — gangguan ketersediaan bersama satu-permintaan — atau merusak status cache yang memengaruhi tenant lain yang berbagi node penyajian.
Vektor serangan
Kirim permintaan multimodal/pembuatan terkendali yang dirancang, nilai cache_salt yang salah format, atau token metode HTTP unik berulang ke endpoint penyajian untuk memicu asersi/penghentian mesin atau pertumbuhan metrik tak terbatas.
Sistem yang terdampak
vLLM < 0.28.0 (CVE-2026-105753 asersi mirror-cache); < 0.30.0 (CVE-2026-105754 penghentian EngineCore /inference/v1/generate + keracunan encoder-cache; CVE-2026-105756 crash cache_salt LMCache-MP; CVE-2026-105757 jalur fatal output terstruktur; CVE-2026-105759 kehabisan memori label Prometheus; CVE-2026-105755 penimpaan cache X-Request-Id /score, /rerank)
Mitigasi
Tingkatkan ke vLLM 0.28.0 (105753) dan 0.30.0 (105754/105756/105757/105759/105755); batasi argumen media/cache tingkat permintaan dan beri batas kecepatan /metrics jika memungkinkan.