事件经过
10 月 5 日发布的一批协调的 vLLM 公告(在 0.28.0/0.30.0 中修复):多模态镜像 LRU 缓存在引擎准入之前提交媒体哈希,因此被拒绝的请求会使缓存失步,后续请求触发断言(105753);分离式 /inference/v1/generate 端点接受调用者提供的张量/哈希/占位符,可以终止共享 EngineCore 并投毒或检索跨请求编码器缓存状态(105754);格式错误的 cache_salt 可以在 LMCache-MP 查找中引发未捕获的 ValueError(105756);结构化输出失败到达 EngineCore 致命路径(105757);未经认证的任意 HTTP 方法令牌使 Prometheus 标签集增长直至内存耗尽(105759);/score、/rerank 从调用者控制的 X-Request-Id 头派生 query_key,实现查询嵌入覆盖(105755)。
影响分析
vLLM 是部署最广泛的开源 LLM 服务后端之一。这些漏洞可由普通 API 调用者到达(前端/后端模式或 OpenAI 兼容端点),每个漏洞都允许单个低权限或未经认证的请求杀死共享 EngineCore——单请求共享可用性中断——或破坏影响共享服务节点的其他租户的缓存状态。
攻击途径
向服务端点发送精心制作的多模态/受限生成请求、格式错误的 cache_salt 值或重复的唯一 HTTP 方法令牌,以触发断言/引擎终止或无限指标增长。
受影响系统
vLLM < 0.28.0(CVE-2026-105753 镜像缓存断言);< 0.30.0(CVE-2026-105754 /inference/v1/generate EngineCore 终止 + 编码器缓存投毒;CVE-2026-105756 LMCache-MP cache_salt 崩溃;CVE-2026-105757 结构化输出致命路径;CVE-2026-105759 Prometheus 标签内存耗尽;CVE-2026-105755 /score、/rerun X-Request-Id 缓存覆盖)
缓解措施
升级到 vLLM 0.28.0(105753)和 0.30.0(105754/105756/105757/105759/105755);尽可能限制请求级媒体/缓存参数并限流 /metrics。