Skip to content

认识 Xinference

开源大模型这两年跟不要钱似的往外冒——DeepSeek、Qwen、Kimi 一个接一个开源,权重文件都能下到硬盘里了。可现实很骨感:你真把一份 Qwen 或 DeepSeek 的权重下载完,面对的是一堆 .safetensors 和配置文件,它既不会聊天,也不会回答你"地球上最大的动物是什么"。想让它开口,还得自己搭服务、写 API、配显存。模型是到手了,灶台却没搭起来。

模型权重是"食材",推理服务才是"灶台"。Xinference 干的事,就是把灶台给你搭好,还顺手把菜单(OpenAI 那套 API)也标准化了——你换一行 base_url 就能把原本调 GPT 的代码,改成调你本地的大模型。

什么是 Xinference

Xinference 全称 Xorbits Inference,一个开源的模型推理与服务(serving)平台。一句话概括:用一条命令,把任意开源大模型(LLM、Embedding、Rerank、多模态、语音、图像、视频)跑成生产级 API。

它的官方 slogan 很直白:

Swap GPT for any LLM by changing a single line of code.(改一行代码,就能用任意开源 LLM 替换 GPT)

背后是 Xinference(Xorbits)开源社区与团队在维护,还有一篇正经的学术论文撑腰——EMNLP 2024 的 "Xinference: Making Large Model Serving Easy"。也就是说,它不是某个大厂顺手甩出来的玩具,而是被学术界当方法论研究过的东西。

它把自己定位在"生产就绪(production-ready)"的推理 API 层:底层可以挂在 vLLM、llama.cpp、SGLang 这些推理引擎上,上面给你统一的 Web UI、集群管理和 OpenAI 兼容接口。你可以把它理解成开源模型界的"模型网关 + 调度中心"——Ollama 偏聊天玩具,vLLM 偏高性能引擎,而 Xinference 是那个把大家编排到一起、还能横向拼机器的"总管"。

Xinference 的特点

  • 一条命令起模型xinference launch 即可拉起一个模型,不用自己手写 FastAPI server、不用管路由和并发,连下载权重都帮你缓存好
  • 统一且兼容 OpenAI 的 API/v1/chat/completions/v1/embeddings/v1/completions 全兼容,连 Function Calling 都支持;甚至把 Anthropic API 也接进来了(base_url 换成 .../anthropic 就能在 Claude Code 里用)
  • 多模型类型通吃:LLM、Embedding、Rerank、Image、Audio、Video、Multimodal,一个平台全管,做 RAG 时 Embedding + Rerank + LLM 一套齐活
  • 多推理引擎自由选:vLLM、SGLang、llama.cpp、Transformers、MLX 任选——Mac 上用 MLX 性能最好,资源紧用 llama.cpp 量化,追求吞吐用 vLLM/SGLang
  • 内置分布式集群:supervisor + 多 worker 架构,跨多机多卡把推理任务自动分发,并发请求自动批处理(auto batch)提升吞吐,一台机器跑不动就拼多台
  • 异构硬件利用:自动调度 GPU / CPU / Apple Metal,消费级显卡也能跑起来
  • 生态无缝对接:原生集成 LangChain、LlamaIndex、Dify、RAGFlow、MaxKB、FastGPT、Xagent 等,几乎主流开源 LLMOps / RAG 平台都能直接拿它当模型后端
  • 双模型源自动识别:自动在 Hugging Face 与 ModelScope 之间选择下载源,国内机器从魔搭(ModelScope)拉模型快得多
  • 部署灵活:pip、Docker、K8s Helm 三种姿势,从你那台笔记本一直到生产集群都能上
  • 持续进化:最新 v3.2.0(2026-08-15) 一口气加了一堆新模型和运维能力(详见下文),上一个稳定版是 v3.1.0(2026-07-31)

谁在用、用在哪

Xinference 不是谁的闭源 SaaS,它是一个"被全世界的开发者、团队和公司自己部署"的开源基础设施。几个典型姿势:

  • 个人开发者:笔记本上 xinference-local,起个 qwen2.5 直接调,把原本写死调 OpenAI 的脚本 base_url 一换,零改造就跑在本地——再也不用担心哪天 API 涨价、数据被拿去训练。
  • RAG / 知识库产品Dify、RAGFlow、MaxKB、FastGPT 等主流开源 LLMOps / 知识库平台,都把 Xinference 作为可选模型后端。企业要做私有化知识库时,上面跑 Embedding + Rerank + LLM 一套齐活,不用东拼西凑四五个服务。
  • 智能体平台 Xagent:基于 Xinference 提供模型服务能力,说明它在"真有人拿它干正事"的场景里能扛住。
  • 学术界与工程界:EMNLP 2024 专门发论文讲它"让大模型服务变简单",这种待遇在数据科学工具里不算常见。

它和 Ollama、vLLM 的关系不是"替代",而是"编排层":底层可以挂在 vLLM / llama.cpp 上,上面给你统一的 Web UI、集群管理和生态集成。一句话——别人给你引擎,Xinference 给你整车

最新发布的 v3.2.0 也印证了它的"通吃"野心:新增了 MiniMax-M3、Ling 3.0 等 LLM,R3 系列 Embedding / Rerank、jina-reranker-v3.5 等检索模型,DeepDoc(ragflow)、OvisOCR2 文档解析与 OCR,IndexTTS 2.5 语音合成,FireRed 图像编辑、Wan2.2 / MiniMax-H3 视频生成,还顺手补上了按副本 GPU 部署、按副本弹性扩缩容、下载源自动探测这些运维刚需。模型种类和工程成熟度,肉眼可见地在长。

Xinference 初体验

想亲手起一个?本地 pip 安装最省事:

bash
pip install "xinference[all]"
xinference-local --host 0.0.0.0 --port 9997

启动后打开 http://127.0.0.1:9997 就是 Web UI——既能点按钮拉模型,也能访问 http://127.0.0.1:9997/docs 看 API 文档。注意 Web UI 是打包进包里的静态前端,不用你额外装 Node.js。

用 vLLM 引擎起个 qwen2.5-instruct 试试:

bash
xinference launch --model-engine vllm -n qwen2.5-instruct -s 0_5 -f pytorch

提醒:从 v0.11.0 起,起 LLM 必须指定 --model-engine(vllm / sglang / llama.cpp / transformers / mlx)。拿不准哪个引擎配哪个模型,用 xinference engine -n qwen2.5-instruct 一查就知道。

起来之后,直接当 OpenAI 用,代码一行都不用改结构:

python
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:9997/v1", api_key="not used actually")

response = client.chat.completions.create(
    model="qwen2.5-instruct",
    messages=[{"role": "user", "content": "地球上最大的动物是什么?"}]
)
print(response)

有 N 卡想上 Docker,一行就够:

bash
docker run -e XINFERENCE_MODEL_SRC=modelscope -p 9998:9997 \
  --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

国内机器记得加 XINFERENCE_MODEL_SRC=modelscope,从魔搭下模型比 Hugging Face 快得多。第一次起模型会下载权重,耐心等几分钟,之后缓存到本地不再重复下。

真要上集群,就在一台机器起 xinference-supervisor、其他机器起 xinference-worker 指向它,推理任务会自动在多机多卡间分发——这才是它"production-ready"的底气。

进阶

Xinference 最爽的点在于:它把"部署开源大模型"这件本该很折腾的事,压成了"选模型 → 点一下 → 拿 API"。你不用先纠结 vLLM 还是 llama.cpp,先用 Web UI 起个小模型聊两句;等业务真要上集群、要管多模态、要接 Dify/RAGFlow 做私有化知识库,再开 supervisor + worker 把机器拼起来,也来得及。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区