认识 vLLM
2025 年底,Hugging Face 做了个让不少人意外的决定:把自己做的推理引擎 TGI 判了"维护模式",推荐大家迁移到 vLLM。一个官方项目把位置让给一个第三方开源库,这在开源圈不多见。
能让 Hugging Face 主动"让位"的,就是我们今天的主角——vLLM,大模型推理领域的事实标准。
说白了,谁要在生产环境跑开源大模型、还要扛并发,第一站基本都绕不开 vLLM。
什么是 vLLM
vLLM 是一个高吞吐、低显存占用的开源大模型推理与服务引擎,采用 Apache 2.0 协议开源。它最初诞生于 UC Berkeley 的 Sky Computing Lab,如今已成长为最活跃的开源 AI 项目之一,聚集了 2000+ 贡献者。
一句话定位:Easy, fast, and cheap LLM serving for everyone——让每个人都能轻松、快速、便宜地服务大模型。
它解决的痛点很具体:大模型推理时,显存被 KV 缓存大量浪费,并发一上来就 OOM 或慢成蜗牛。vLLM 就是来治这个的。
vLLM 的特点
- 开源免费,Apache 2.0 协议
- 招牌创新 PagedAttention:像操作系统管虚拟内存那样管 KV 缓存,按需分页,显存碎片近乎为零
- 连续批处理(Continuous Batching)+ 分块预填充(Chunked Prefill)+ 前缀缓存,大幅提升吞吐
- 无缝支持 200+ HuggingFace 模型架构(Llama、Qwen、DeepSeek-V3、Mamba、LLaVA 等)
- 量化全家桶:FP8、INT4/8、GPTQ、AWQ、GGUF 等
- 分布式推理:张量/流水线/数据/专家/上下文并行
- OpenAI 兼容 API,外加 Anthropic Messages API 和 gRPC
- 跨硬件:NVIDIA / AMD GPU、x86/ARM/PowerPC CPU,插件还支持 TPU、华为昇腾、Apple Silicon 等
- 推测解码(Speculative Decoding)进一步压榨吞吐
为什么 vLLM 能成为事实标准
一战成名的 PagedAttention
传统推理给每个请求预分配一大块固定显存放 KV 缓存,但多数请求根本用不满,60-80% 的空间白白闲置。vLLM 的 PagedAttention 借鉴操作系统的虚拟内存分页机制,KV 缓存按固定大小的"页"按需分配、用完即还,还能在不同请求间共享相同前缀(比如同一个系统提示词)。
结果是:同等显存下能塞下多得多的并发请求,吞吐比原始 HuggingFace Transformers 高出一个数量级。这项工作发表在 SOSP 2023。
持续进化的架构
vLLM 没躺在 PagedAttention 的功劳簿上。V1 架构在 2025 年成为默认执行路径,Model Runner V2 在 2026 年接力成为新的默认核心,持续重写执行引擎,让量化模型、推测解码、CUDA 图等能力跑得更顺。这也是 Hugging Face 敢把 TGI 交给它的底气。
大厂用脚投票
- Amazon 的 Rufus AI 助手用它服务 2.5 亿用户
- Roblox 每周经它处理 40 亿 token
- LinkedIn 的招聘助手也跑在 vLLM 上
2026 年初,vLLM 核心研究团队成立了公司 Inferact,首轮融资估值 8 亿美元——开源项目商业化,底气十足。
vLLM 初体验
想亲手跑一下?两步就能起一个 OpenAI 兼容的推理服务。
- 安装
pip install vllm- 启动服务(以 Llama 为例)
vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2启动后会在 localhost:8000 暴露一个 OpenAI 兼容 API,任何用 OpenAI SDK 写的应用,把 base_url 指过来就能直接用,代码一行不用改。
没有 GPU 也能先翻文档过过瘾;真要跑大模型,vLLM 对显存调优有讲究,建议从 7B 以下的小模型上手。
进阶
vLLM 的迷人之处在于:它把"大模型推理"这件本该很吃显存、很讲究工程的事,压成了一个 vllm serve 命令。你不用先啃 KV 缓存论文,先把模型跑起来,等并发压上来了再回头调参,也来得及。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
