事件经过
vLLM 的聊天完成端点允许远程提供的 chat_template 值在 Jinja 呈现期间驱动不受控制的资源消耗,这是共享服务基础设施上的拒绝服务风险。
影响分析
与本周期 vLLM 资源耗尽问题的更广泛模式一致,这影响任何允许调用者影响聊天模板的多租户 OpenAI 兼容 vLLM 部署,冒着该实例上所有租户的可用性风险。
攻击途径
远程调用者可以操纵传递给 /v1/chat/completions 的 chat_template 参数,以在 Jinja 模板呈现期间导致过度的资源消耗,降低共享推理服务的性能。
受影响系统
vllm-project vLLM,版本至 0.27.1
缓解措施
跟踪并应用上游 vLLM 修复;在此期间,限制谁可以在多租户端点上设置自定义 chat_template 值,并应用请求级别的资源限制。