Apa yang terjadi
Versi vLLM >=0.10.2 dan <0.28.0 tidak menerapkan batas ukuran atau durasi dekode audio apa pun saat mengekstrak audio dari input video untuk model NanoNemotronVL. Dalam nano_nemotron_vl.py, _extract_audio_from_videos memanggil load_audio_pyav(BytesIO(video_bytes)) tanpa melewatkan parameter max_duration_s atau max_decode_bytes, memungkinkan penyerang untuk menyuplai video kecil yang sangat terkompresi yang memaksa server untuk mengalokasikan gigabyte memori selama dekode audio, menghasilkan denial of service.
Mengapa penting
Permintaan payload kecil dengan upaya rendah dapat menghabiskan memori di server inferensi multimodal bersama, mengganggu ketersediaan untuk semua pengguna instance vLLM itu — DoS amplifikasi klasik terhadap infrastruktur inferensi AI tanpa bypass autentikasi yang diperlukan di luar akses API normal.
Vektor serangan
Klien terotentikasi mengisubmit file video kecil yang sangat terkompresi ke endpoint multimodal; jalur ekstraksi audio mendekodenya tanpa batas ukuran/durasi, menyebabkan alokasi memori skala gigabyte dan crash server.
Sistem yang terdampak
vLLM >=0.10.2, <0.28.0 (dukungan model NanoNemotronVL)
Mitigasi
Tingkatkan ke vLLM 0.28.0 atau lebih baru, yang memberlakukan batas max_duration_s/max_decode_bytes pada jalur ekstraksi audio NanoNemotronVL.