Skip to content

认识 vLLM

2025 年底,Hugging Face 做了个让不少人意外的决定:把自己做的推理引擎 TGI 判了"维护模式",推荐大家迁移到 vLLM。一个官方项目把位置让给一个第三方开源库,这在开源圈不多见。

能让 Hugging Face 主动"让位"的,就是我们今天的主角——vLLM,大模型推理领域的事实标准。

说白了,谁要在生产环境跑开源大模型、还要扛并发,第一站基本都绕不开 vLLM。

什么是 vLLM

vLLM 是一个高吞吐、低显存占用的开源大模型推理与服务引擎,采用 Apache 2.0 协议开源。它最初诞生于 UC Berkeley 的 Sky Computing Lab,如今已成长为最活跃的开源 AI 项目之一,聚集了 2000+ 贡献者。

一句话定位:Easy, fast, and cheap LLM serving for everyone——让每个人都能轻松、快速、便宜地服务大模型。

它解决的痛点很具体:大模型推理时,显存被 KV 缓存大量浪费,并发一上来就 OOM 或慢成蜗牛。vLLM 就是来治这个的。

vLLM 的特点

  • 开源免费,Apache 2.0 协议
  • 招牌创新 PagedAttention:像操作系统管虚拟内存那样管 KV 缓存,按需分页,显存碎片近乎为零
  • 连续批处理(Continuous Batching)+ 分块预填充(Chunked Prefill)+ 前缀缓存,大幅提升吞吐
  • 无缝支持 200+ HuggingFace 模型架构(Llama、Qwen、DeepSeek-V3、Mamba、LLaVA 等)
  • 量化全家桶:FP8、INT4/8、GPTQ、AWQ、GGUF 等
  • 分布式推理:张量/流水线/数据/专家/上下文并行
  • OpenAI 兼容 API,外加 Anthropic Messages API 和 gRPC
  • 跨硬件:NVIDIA / AMD GPU、x86/ARM/PowerPC CPU,插件还支持 TPU、华为昇腾、Apple Silicon 等
  • 推测解码(Speculative Decoding)进一步压榨吞吐

为什么 vLLM 能成为事实标准

一战成名的 PagedAttention

传统推理给每个请求预分配一大块固定显存放 KV 缓存,但多数请求根本用不满,60-80% 的空间白白闲置。vLLM 的 PagedAttention 借鉴操作系统的虚拟内存分页机制,KV 缓存按固定大小的"页"按需分配、用完即还,还能在不同请求间共享相同前缀(比如同一个系统提示词)。

结果是:同等显存下能塞下多得多的并发请求,吞吐比原始 HuggingFace Transformers 高出一个数量级。这项工作发表在 SOSP 2023。

持续进化的架构

vLLM 没躺在 PagedAttention 的功劳簿上。V1 架构在 2025 年成为默认执行路径,Model Runner V2 在 2026 年接力成为新的默认核心,持续重写执行引擎,让量化模型、推测解码、CUDA 图等能力跑得更顺。这也是 Hugging Face 敢把 TGI 交给它的底气。

大厂用脚投票

  • Amazon 的 Rufus AI 助手用它服务 2.5 亿用户
  • Roblox 每周经它处理 40 亿 token
  • LinkedIn 的招聘助手也跑在 vLLM 上

2026 年初,vLLM 核心研究团队成立了公司 Inferact,首轮融资估值 8 亿美元——开源项目商业化,底气十足。

vLLM 初体验

想亲手跑一下?两步就能起一个 OpenAI 兼容的推理服务。

  1. 安装
bash
pip install vllm
  1. 启动服务(以 Llama 为例)
bash
vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2

启动后会在 localhost:8000 暴露一个 OpenAI 兼容 API,任何用 OpenAI SDK 写的应用,把 base_url 指过来就能直接用,代码一行不用改。

没有 GPU 也能先翻文档过过瘾;真要跑大模型,vLLM 对显存调优有讲究,建议从 7B 以下的小模型上手。

进阶

vLLM 的迷人之处在于:它把"大模型推理"这件本该很吃显存、很讲究工程的事,压成了一个 vllm serve 命令。你不用先啃 KV 缓存论文,先把模型跑起来,等并发压上来了再回头调参,也来得及。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区