Apa yang terjadi
Pada 2026-09-26 NVD menerbitkan klaster bypass DoS/batas sumber daya vLLM yang diperbaiki di 0.29.0: media diambil/dimaterialisasi sebelum batas ukuran/item ditegakkan di empat jalur masuk; stop_token_ids divalidasi sebagai bilangan bulat tetapi tidak terhadap rentang kosakata (crash dengan min_tokens saat OOB); cache_salt tidak memiliki validasi panjang maksimum dan diproses di thread serializer; validasi panjang prompt decoder dilewati untuk model skip_prompt_length_check di endpoint disaggregated; PyNvVideoCodec sampler-subclass shadowing melewati batas decoder.
Mengapa penting
vLLM adalah backend inferensi standar yang di-host sendiri untuk aplikasi LLM produksi; ini semua adalah cara jarak jauh dengan gesekan rendah untuk crash atau menghabiskan armada penyajian (bakar memori/bandwidth pra-inferensi dan kegagalan pekerja) di mana mesin terekspos internet. Agregasi penting: beberapa jalur DoS tanpa autentikasi independen diperbaiki dalam satu rilis.
Vektor serangan
Klien tanpa autentikasi mengirimkan media jarak jauh/inline yang terlalu besar sebelum VLLM_MAX_AUDIO_CLIP_FILESIZE_MB / --limit-mm-per-prompt ditegakkan (kehabisan memori+bandwidth); stop_token_ids di luar kosakata dengan min_tokens>0 mencapai MinTokensLogitsProcessor untuk crash pekerja; cache_salt besar diproses di thread penjadwal EngineCore tunggal; prompt decoder yang terlalu panjang dalam penyajian disagg meluap baris NumPy lebar tetap.
Sistem yang terdampak
vLLM < 0.29.0 (endpoint penyajian kompatibel OpenAI/Anthropic dan disaggregated, decoding audio-video chat/batch, frontend Rust /tokenize dan rute /inference/v1/generate).
Mitigasi
Tingkatkan vLLM ke 0.29.0 (bundel tambalan di GHSA-p6g9-7v3x-m8mv, GHSA-3mqx-f33v-vgp9, GHSA-wpww-v874-ph2p, GHSA-jcq2-4gch-5qhf, GHSA-qff2-492f-9fm4, GHSA-v5gm-qgmv-gc6c). Batasi akses tanpa autentikasi ke rute /tokenize; validasi id token stop di hulu.