事件经过
vLLM 的不相交预填充/解码服务架构无法释放被拒绝请求的解码端元数据,因此来自任何未认证客户端的 max_tokens=0 请求流可以耗尽工作进程内存并强制重启。
影响分析
vLLM 是部署最广泛的开源 LLM 推理引擎之一;对常见生产扩展模式(不相交服务)的未认证远程 DoS 可以使任何依赖它的应用程序的推理能力瘫痪,不需要身份验证即可触发。
攻击途径
远程攻击者提交 max_tokens=0 的请求,这些请求被拒绝但其解码端元数据永远不会被清理,允许无限累积,直到耗尽解码工作进程内存并导致工作进程重启 — 对推理服务的拒绝服务攻击。
受影响系统
vLLM 至 0.29.0 版本(不相交预填充/解码部署)
缓解措施
升级到解决此问题的 vLLM 补丁版本(参考项目的 GitHub 安全跟踪器);在此期间监控不相交部署中的解码工作进程内存。