---
url: /vllm/introduction.md
description: vLLM 是高吞吐、低显存的开源大模型推理与服务引擎，源于 UC Berkeley，已成为生产环境的事实标准。
---

# 认识 vLLM

2025 年底，Hugging Face 做了个让不少人意外的决定：把自己做的推理引擎 TGI 判了"维护模式"，推荐大家迁移到 vLLM。一个官方项目把位置让给一个第三方开源库，这在开源圈不多见。

能让 Hugging Face 主动"让位"的，就是我们今天的主角——vLLM，大模型推理领域的事实标准。

> 说白了，谁要在生产环境跑开源大模型、还要扛并发，第一站基本都绕不开 vLLM。

## 什么是 vLLM

vLLM 是一个高吞吐、低显存占用的开源大模型推理与服务引擎，采用 Apache 2.0 协议开源。它最初诞生于 UC Berkeley 的 Sky Computing Lab，如今已成长为最活跃的开源 AI 项目之一，聚集了 2000+ 贡献者。

一句话定位：**Easy, fast, and cheap LLM serving for everyone**——让每个人都能轻松、快速、便宜地服务大模型。

> 它解决的痛点很具体：大模型推理时，显存被 KV 缓存大量浪费，并发一上来就 OOM 或慢成蜗牛。vLLM 就是来治这个的。

## vLLM 的特点

* 开源免费，Apache 2.0 协议
* 招牌创新 PagedAttention：像操作系统管虚拟内存那样管 KV 缓存，按需分页，显存碎片近乎为零
* 连续批处理（Continuous Batching）+ 分块预填充（Chunked Prefill）+ 前缀缓存，大幅提升吞吐
* 无缝支持 200+ HuggingFace 模型架构（Llama、Qwen、DeepSeek-V3、Mamba、LLaVA 等）
* 量化全家桶：FP8、INT4/8、GPTQ、AWQ、GGUF 等
* 分布式推理：张量/流水线/数据/专家/上下文并行
* OpenAI 兼容 API，外加 Anthropic Messages API 和 gRPC
* 跨硬件：NVIDIA / AMD GPU、x86/ARM/PowerPC CPU，插件还支持 TPU、华为昇腾、Apple Silicon 等
* 推测解码（Speculative Decoding）进一步压榨吞吐

## 为什么 vLLM 能成为事实标准

#### 一战成名的 PagedAttention

传统推理给每个请求预分配一大块固定显存放 KV 缓存，但多数请求根本用不满，60-80% 的空间白白闲置。vLLM 的 PagedAttention 借鉴操作系统的虚拟内存分页机制，KV 缓存按固定大小的"页"按需分配、用完即还，还能在不同请求间共享相同前缀（比如同一个系统提示词）。

> 结果是：同等显存下能塞下多得多的并发请求，吞吐比原始 HuggingFace Transformers 高出一个数量级。这项工作发表在 SOSP 2023。

#### 持续进化的架构

vLLM 没躺在 PagedAttention 的功劳簿上。V1 架构在 2025 年成为默认执行路径，Model Runner V2 在 2026 年接力成为新的默认核心，持续重写执行引擎，让量化模型、推测解码、CUDA 图等能力跑得更顺。这也是 Hugging Face 敢把 TGI 交给它的底气。

#### 大厂用脚投票

* **Amazon** 的 Rufus AI 助手用它服务 2.5 亿用户
* **Roblox** 每周经它处理 40 亿 token
* **LinkedIn** 的招聘助手也跑在 vLLM 上

> 2026 年初，vLLM 核心研究团队成立了公司 Inferact，首轮融资估值 8 亿美元——开源项目商业化，底气十足。

## vLLM 初体验

想亲手跑一下？两步就能起一个 OpenAI 兼容的推理服务。

1. 安装

```bash
pip install vllm
```

2. 启动服务（以 Llama 为例）

```bash
vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2
```

启动后会在 `localhost:8000` 暴露一个 OpenAI 兼容 API，任何用 OpenAI SDK 写的应用，把 `base_url` 指过来就能直接用，代码一行不用改。

> 没有 GPU 也能先翻文档过过瘾；真要跑大模型，vLLM 对显存调优有讲究，建议从 7B 以下的小模型上手。

## 进阶

vLLM 的迷人之处在于：它把"大模型推理"这件本该很吃显存、很讲究工程的事，压成了一个 `vllm serve` 命令。你不用先啃 KV 缓存论文，先把模型跑起来，等并发压上来了再回头调参，也来得及。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
