---
url: /xinference/introduction.md
description: >-
  Xinference（Xorbits Inference）是开源大模型一键部署与推理服务平台，一条命令拉起
  LLM、Embedding、Rerank、多模态模型，提供兼容 OpenAI 的统一 API，支持单机到多机分布式集群，本地或云端皆可私有化部署开源大模型。
---

# 认识 Xinference

开源大模型这两年跟不要钱似的往外冒——DeepSeek、Qwen、Kimi 一个接一个开源，权重文件都能下到硬盘里了。可现实很骨感：你真把一份 Qwen 或 DeepSeek 的权重下载完，面对的是一堆 `.safetensors` 和配置文件，它既不会聊天，也不会回答你"地球上最大的动物是什么"。想让它开口，还得自己搭服务、写 API、配显存。模型是到手了，灶台却没搭起来。

> 模型权重是"食材"，推理服务才是"灶台"。Xinference 干的事，就是把灶台给你搭好，还顺手把菜单（OpenAI 那套 API）也标准化了——你换一行 `base_url` 就能把原本调 GPT 的代码，改成调你本地的大模型。

## 什么是 Xinference

Xinference 全称 **Xorbits Inference**，一个开源的**模型推理与服务（serving）平台**。一句话概括：用一条命令，把任意开源大模型（LLM、Embedding、Rerank、多模态、语音、图像、视频）跑成生产级 API。

它的官方 slogan 很直白：

> **Swap GPT for any LLM by changing a single line of code.**（改一行代码，就能用任意开源 LLM 替换 GPT）

背后是 Xinference（Xorbits）开源社区与团队在维护，还有一篇正经的学术论文撑腰——EMNLP 2024 的 *"Xinference: Making Large Model Serving Easy"*。也就是说，它不是某个大厂顺手甩出来的玩具，而是被学术界当方法论研究过的东西。

它把自己定位在"生产就绪（production-ready）"的推理 API 层：底层可以挂在 vLLM、llama.cpp、SGLang 这些推理引擎上，上面给你统一的 Web UI、集群管理和 OpenAI 兼容接口。你可以把它理解成**开源模型界的"模型网关 + 调度中心"**——Ollama 偏聊天玩具，vLLM 偏高性能引擎，而 Xinference 是那个把大家编排到一起、还能横向拼机器的"总管"。

## Xinference 的特点

* **一条命令起模型**：`xinference launch` 即可拉起一个模型，不用自己手写 FastAPI server、不用管路由和并发，连下载权重都帮你缓存好
* **统一且兼容 OpenAI 的 API**：`/v1/chat/completions`、`/v1/embeddings`、`/v1/completions` 全兼容，连 Function Calling 都支持；甚至把 Anthropic API 也接进来了（`base_url` 换成 `.../anthropic` 就能在 Claude Code 里用）
* **多模型类型通吃**：LLM、Embedding、Rerank、Image、Audio、Video、Multimodal，一个平台全管，做 RAG 时 Embedding + Rerank + LLM 一套齐活
* **多推理引擎自由选**：vLLM、SGLang、llama.cpp、Transformers、MLX 任选——Mac 上用 MLX 性能最好，资源紧用 llama.cpp 量化，追求吞吐用 vLLM/SGLang
* **内置分布式集群**：supervisor + 多 worker 架构，跨多机多卡把推理任务自动分发，并发请求自动批处理（auto batch）提升吞吐，一台机器跑不动就拼多台
* **异构硬件利用**：自动调度 GPU / CPU / Apple Metal，消费级显卡也能跑起来
* **生态无缝对接**：原生集成 LangChain、LlamaIndex、Dify、RAGFlow、MaxKB、FastGPT、Xagent 等，几乎主流开源 LLMOps / RAG 平台都能直接拿它当模型后端
* **双模型源自动识别**：自动在 Hugging Face 与 ModelScope 之间选择下载源，国内机器从魔搭（ModelScope）拉模型快得多
* **部署灵活**：pip、Docker、K8s Helm 三种姿势，从你那台笔记本一直到生产集群都能上
* **持续进化**：最新 **v3.2.0（2026-08-15）** 一口气加了一堆新模型和运维能力（详见下文），上一个稳定版是 v3.1.0（2026-07-31）

## 谁在用、用在哪

Xinference 不是谁的闭源 SaaS，它是一个"被全世界的开发者、团队和公司自己部署"的开源基础设施。几个典型姿势：

* **个人开发者**：笔记本上 `xinference-local`，起个 qwen2.5 直接调，把原本写死调 OpenAI 的脚本 `base_url` 一换，零改造就跑在本地——再也不用担心哪天 API 涨价、数据被拿去训练。
* **RAG / 知识库产品**：**Dify、RAGFlow、MaxKB、FastGPT** 等主流开源 LLMOps / 知识库平台，都把 Xinference 作为可选模型后端。企业要做私有化知识库时，上面跑 Embedding + Rerank + LLM 一套齐活，不用东拼西凑四五个服务。
* **智能体平台 Xagent**：基于 Xinference 提供模型服务能力，说明它在"真有人拿它干正事"的场景里能扛住。
* **学术界与工程界**：EMNLP 2024 专门发论文讲它"让大模型服务变简单"，这种待遇在数据科学工具里不算常见。

> 它和 Ollama、vLLM 的关系不是"替代"，而是"编排层"：底层可以挂在 vLLM / llama.cpp 上，上面给你统一的 Web UI、集群管理和生态集成。一句话——**别人给你引擎，Xinference 给你整车**。

最新发布的 **v3.2.0** 也印证了它的"通吃"野心：新增了 MiniMax-M3、Ling 3.0 等 LLM，R3 系列 Embedding / Rerank、jina-reranker-v3.5 等检索模型，DeepDoc（ragflow）、OvisOCR2 文档解析与 OCR，IndexTTS 2.5 语音合成，FireRed 图像编辑、Wan2.2 / MiniMax-H3 视频生成，还顺手补上了**按副本 GPU 部署、按副本弹性扩缩容、下载源自动探测**这些运维刚需。模型种类和工程成熟度，肉眼可见地在长。

## Xinference 初体验

想亲手起一个？本地 pip 安装最省事：

```bash
pip install "xinference[all]"
xinference-local --host 0.0.0.0 --port 9997
```

启动后打开 `http://127.0.0.1:9997` 就是 Web UI——既能点按钮拉模型，也能访问 `http://127.0.0.1:9997/docs` 看 API 文档。注意 Web UI 是打包进包里的静态前端，不用你额外装 Node.js。

用 vLLM 引擎起个 qwen2.5-instruct 试试：

```bash
xinference launch --model-engine vllm -n qwen2.5-instruct -s 0_5 -f pytorch
```

> 提醒：从 v0.11.0 起，起 LLM 必须指定 `--model-engine`（vllm / sglang / llama.cpp / transformers / mlx）。拿不准哪个引擎配哪个模型，用 `xinference engine -n qwen2.5-instruct` 一查就知道。

起来之后，直接当 OpenAI 用，代码一行都不用改结构：

```python
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:9997/v1", api_key="not used actually")

response = client.chat.completions.create(
    model="qwen2.5-instruct",
    messages=[{"role": "user", "content": "地球上最大的动物是什么？"}]
)
print(response)
```

有 N 卡想上 Docker，一行就够：

```bash
docker run -e XINFERENCE_MODEL_SRC=modelscope -p 9998:9997 \
  --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0
```

> 国内机器记得加 `XINFERENCE_MODEL_SRC=modelscope`，从魔搭下模型比 Hugging Face 快得多。第一次起模型会下载权重，耐心等几分钟，之后缓存到本地不再重复下。

真要上集群，就在一台机器起 `xinference-supervisor`、其他机器起 `xinference-worker` 指向它，推理任务会自动在多机多卡间分发——这才是它"production-ready"的底气。

## 进阶

Xinference 最爽的点在于：它把"部署开源大模型"这件本该很折腾的事，压成了"选模型 → 点一下 → 拿 API"。你不用先纠结 vLLM 还是 llama.cpp，先用 Web UI 起个小模型聊两句；等业务真要上集群、要管多模态、要接 Dify/RAGFlow 做私有化知识库，再开 supervisor + worker 把机器拼起来，也来得及。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
