何が起きたか
2026年9月26日にNVDは0.29.0で修正されたvLLMのDoS/リソース制限迂回のクラスターを公開した:メディアがサイズ/アイテム上限の適用前に4つの入力経路で取得/実体化される。stop_token_idsは整数として検証されるが語彙範囲に対しては検証されない(OOB時にmin_tokensでクラッシュ)。cache_saltに最大長検証がなく、シリアライザースレッドで処理される。ディスアグリゲーションエンドポイントでskip_prompt_length_checkモデルのデコーダープロンプト長検証がスキップされる。PyNvVideoCodecサンプラーサブクラスシャドーイングがデコーダー制限を迂回する。
なぜ重要か
vLLMは本番LLMアプリケーションの標準的なセルフホスト推論バックエンドである。これらはすべて、エンジンがインターネットに露出している場合に、サービングフリートをクラッシュまたは枯渇させるリモートで低摩擦な方法(推論前のメモリ/帯域幅消費とワーカー障害)である。集約が重要である:単一リリースで修正された複数の独立した認証なしDoS経路。
攻撃経路
認証なしクライアントが、VLLM_MAX_AUDIO_CLIP_FILESIZE_MB / --limit-mm-per-promptが適用される前に過大なリモート/インラインのメディアを送信する(メモリ+帯域幅の枯渇)。語彙外のstop_token_idsとmin_tokens>0がMinTokensLogitsProcessorに到達しワーカーをクラッシュさせる。大きなcache_saltが単一のEngineCoreスケジューラースレッドで処理される。ディスアグリゲーションサービングでの過長なデコーダープロンプトが固定幅NumPy行をオーバーフローさせる。
影響を受けるシステム
vLLM 0.29.0未満(OpenAI/Anthropic互換およびディスアグリゲーションサービングエンドポイント、チャット/バッチオーディオビデオデコード、Rustフロントエンド /tokenize および /inference/v1/generate ルート)。
緩和策
vLLMを0.29.0にアップグレード(GHSA-p6g9-7v3x-m8mv、GHSA-3mqx-f33v-vgp9、GHSA-wpww-v874-ph2p、GHSA-jcq2-4gch-5qhf、GHSA-qff2-492f-9fm4、GHSA-v5gm-qgmv-gc6cのパッチバンドル)。/tokenizeルートへの認証なしアクセスを制限。stop token IDを上流で検証。