Kerentanan  ·  2026-09-19

vLLM — decode-worker memory exhaustion via unbounded rejected-request cleanup in disaggregated prefill/decode deployments

KerentananHigh dampakGlobalCVE-2026-93436
Arsitektur serving prefill/decode disaggregat vLLM gagal merilis metadata sisi decode untuk permintaan yang ditolak, sehingga aliran permintaan max_tokens=0 dari klien unauthenticated apa pun dapat menghabiskan memori worker dan memaksa restart.
vLLM adalah salah satu mesin inferensi LLM open-source yang paling banyak digunakan; DoS jarak jauh unauthenticated terhadap pola penskalaan produksi umum (disaggregated serving) dapat menyebabkan kapasitas inferensi turun untuk aplikasi apa pun yang bergantung padanya, tanpa autentikasi yang diperlukan untuk memicunya.
Penyerang jarak jauh mengirimkan permintaan dengan max_tokens=0, yang ditolak tetapi metadata sisi decode-nya tidak pernah dibersihkan, memungkinkan akumulasi tak terbatas yang menghabiskan memori decode-worker sampai worker restart — denial-of-service terhadap layanan inferensi.
vLLM through 0.29.0 (disaggregated prefill/decode deployments)
Upgrade ke patch vLLM yang mengatasi masalah ini sesuai dengan security tracker GitHub proyek; monitor memori decode-worker di deployment disaggregat sambil menunggu.
vLLM GitHub repositoryNVD CVE-2026-93436
Lihat di umpan langsung Jelajahi temuan keamanan dan tata kelola AI terkait — diperbarui setiap pagi.
Buka umpan →