Apa yang terjadi
Satu permintaan jaringan unauthenticated dengan crafted negative token ID ke API embeddings/pooling vLLM memicu CUDA assertion fatal, meracuni konteks GPU bersama dan menolak layanan untuk setiap permintaan lain pada instance inferensi tersebut.
Mengapa penting
Ini adalah DoS unauthenticated trivial yang dapat dieksploitasi, permintaan tunggal terhadap konteks GPU multi-tenant mesin inferensi yang widely-deployed — satu permintaan jahat menurunkan layanan untuk semua pengguna/tenant co-located sampai operator me-restart proses, risiko ketersediaan berat untuk deployment vLLM bersama apa pun.
Vektor serangan
vLLM gagal memvalidasi lower bound token ID yang dikirimkan ke endpoint /v1/embeddings dan /pooling; satu permintaan yang berisi negative token ID memicu CUDA device-side assertion yang meracuni konteks GPU, menyebabkan semua permintaan berikutnya pada engine itu gagal sampai proses di-restart.
Sistem yang terdampak
vLLM before 0.28.0
Mitigasi
Upgrade ke vLLM 0.28.0 atau lebih baru sesuai dengan GitHub Security Advisory GHSA-25q3-v2hm-8vpf.