Skip to content

认识 NVIDIA PAIR:把家里闲置电脑拼成一个本地 AI 算力池,Apache 2.0 开源

先说个我最近反复遇到的场景。

我在主力机上跑本地 Agent,让它把一份两百页的产品手册拆成十个子任务并行摘要。命令行一动,风扇立刻起飞,GPU 占用拉到 100%,进度条爬得像拔牙。

而就在同一张桌子上,我的另一台游戏本合着盖在充电,旁边那台旧工作站开着机只用来挂下载。

三台机器,只有一台在拼命,另外两台在看戏。

这事最扎心的地方在于:不是模型不够聪明,是算力分工太原始了——所有推理请求都排在同一块 GPU 后面的同一条队里。就像全家只有一台打印机,人人都说"我就打两页",结果谁也没快起来。

NVIDIA 2026 年 9 月 3 日在 IFA 2026 上丢出来一个东西,专门治这个:NVIDIA PAIR(Personal AI Router)。免费的、开源的、Apache 2.0 协议,目前是公开 Beta(v0.1.1)。

它的定位一句话说清:不是又一个推理引擎,而是一层"虚拟推理路由器"——谁有空,谁接下一单。

什么是 NVIDIA PAIR

NVIDIA PAIR 是一个跑在你本地网络里的虚拟推理路由器(virtual inference router)。它自己不跑模型,真正的活还是 Ollama 或 LM Studio 干,PAIR 只负责三件事:发现网络里有哪些机器能干活、判断哪台现在最合适、把请求送过去再把答案原路带回来。

先把最大的误解掐死在摇篮里,因为它太容易被误读了:

PAIR 不会把多张显卡拼成一张"超级显卡",不会池化显存,也不会把一次请求切开分给多台机器。 每个独立的推理请求,被分配给一个合格节点,并在那台机器上从头跑到尾。

所以如果你的痛点是"我 8GB 显存装不下这个 70B 模型",PAIR 救不了你,两台 8GB 也不会因为它突然变成 16GB。硬件不会因为工具取了个好听的名字就突然开会通过预算。

但如果你的痛点是"我有两三台都能跑中等模型的机器,任务一多就全挤在一条队上"——那 PAIR 就是冲着你来的。它提升的是并发吞吐的总量,不是单个模型的装载上限。

它最聪明的一个设计决策,我认为是这个:

不发明新 API。

PAIR 直接代理你已经在用的 Ollama 兼容接口和 LM Studio 兼容接口(接管各自默认端口,端口可在引擎设置里改),仓库里还额外暴露 OpenAI 兼容端点。也就是说——你现有的 Agent、Harness、脚本、应用,一行代码都不用改,只要它本来就会说 Ollama 话或 OpenAI 话,它就已经会"用集群"了。

Agent 负责决定要干什么,PAIR 负责决定在哪台机器上干。

源码在 github.com/NVIDIA/Personal-AI-Router,Apache 2.0,可以翻、可以 fork、可以提 PR。

它有什么特点

  • 零改动的接入方式:代理 Ollama / LM Studio 现有接口,兼容 OpenAI 端点。不用给你的 Agent 工具链动手术,也不用为了"集群"先补一门分布式系统课。这比那些要求你重写一遍调用层的方案友好太多了。
  • mDNS 自动发现 + 6 位 PIN 配对:同一局域网内的机器自动被找到,发现失败时也能手动按 IP 添加。信任靠一次 6 位验证码握手建立,配对完成之前,节点之间的所有通信一律拦截。
  • mTLS 加密传输:配对后节点间通信用生成的证书走双向 TLS。提示词、文件、上下文全都留在你自己的局域网里——不上云,不经过任何人的服务器
  • 五信号实时调度:每次请求,调度器同时权衡五件事——① 节点是否在线且就绪;② 所需引擎是否已启用;③ 请求的那个确切模型在这台机器上存不存在;④ 节点与引擎当前的排队深度;⑤ 现有 GPU 利用率。五项全过才算"合格节点"。
  • 弹性成员(elastic clients):机器开机就贡献算力,关机、休眠、被拿去打游戏就自动退出调度池。不会因为你老婆把笔记本合上,整个集群就崩给你看。
  • 能帮你装引擎、拉模型:PAIR 可以在配对好的机器上直接安装 Ollama / LM Studio 并启动模型下载,省掉大量跨机器手工配置。
  • 异构混搭,不挑阵营:Windows、macOS、Linux 可以互相配对,x64 和 arm64 都行(Windows on ARM 为实验性)。一台 Windows 游戏台式机 + 一台 MacBook + 一台 Linux 工作站,可以组成同一个集群。
  • GUI 和终端双界面:不想敲命令的人有图形界面,想自动化的人有 CLI,不是只给极客准备的玩具。

谁在用、能干什么

说实话,PAIR 是 9 月 3 日刚发布的新东西,还拿不出"某某公司生产环境跑了三个月"这类第三方案例。我不编。但它背后的生态和官方给出的实测数据,是能查证的。

NVIDIA 官方演示(developer.nvidia.com 技术博客)

用 Nous Research 的 Hermes Desktop 搭一个 5 子智能体任务,让它整理一个"周日收件箱"——把堆积的邮件分成"立即处理""稍后处理""直接略过"三类。推理由 Ollama 执行 Qwen 3.6 35B A3B

部署方式耗时
单台 RTX Spark 笔记本平均 18 分钟
3 节点 PAIR 集群(RTX Spark 笔记本 + DGX Spark + RTX 5090)平均 8 分 48 秒

差不多快了一倍。要提醒一句:这是 NVIDIA 自家演示,不是第三方独立复现,量力看待。

闲置算力到底有多大:NVIDIA 在 IFA 上的说法是,超过一半的美国家庭拥有 2 台及以上 PC,而这些设备的日均利用率只有约 17%(差不多一天 4 小时)。折算下来,一个典型多设备家庭闲置的算力,每天大约能产出 1.2 亿 Token——对标高价云端 API 相当于每月 1200 美元额度,而电费成本大概 120 美元。这个账算得夸张了点,但方向没毛病:你花大价钱买的 GPU,大部分时间在待机。

典型落场景

  • 多智能体并行:主 Agent 把大任务拆成 N 个子任务,以前排队等同一块 GPU,现在分散到不同机器真正并行。
  • 多任务并发:一个窗口读 README,一个窗口改命名,一个窗口生成测试,互不抢道。
  • 主力机卸载:你要打游戏、剪视频的时候,AI 负载自动挪到别的机器上,不跟你抢显卡。

生态联动也是这次发布的重头戏。NVIDIA 同时宣布 Hermes Agent、OpenClaw、Perplexity Portable Computer 将提供一键本地模型部署(均基于 llama.cpp,集成 NVIDIA 推理优化);OpenClaw 目前已经是 GitHub 星标最多的 AI 项目(NVIDIA 博客口径 38 万+ Star)。推理侧同期的加速数据:llama.cpp 最高 1.9 倍vLLM 在双 DGX Spark 上最高 1.4 倍,这些优化已经通过 LM Studio 和 Ollama 下发。

至于硬件,RTX Spark 系列(1 Petaflop Blackwell GPU、最高 128GB 统一内存、20 核 Grace CPU)将于 2026 年 10 月上市,PAIR 从第一天起就能让这些机器在集群里扮演角色。

初体验:五步把它跑起来

想试的话,最小路径其实很短——先在一台机器上跑通,再加第二台验证分发

第一步,对一下硬件门槛。 支持 GeForce RTX 20 系及更新、RTX PRO 工作站 GPU(图灵架构及更新)、DGX Spark,以及 Apple M4 及更新芯片(是的,Mac 也能入伙)。系统要求 Windows / macOS / Linux,官方验证配置标注 8GB 内存以上、建议 20GB 磁盘。先对清楚,免得半夜排查驱动越查越清醒。

第二步,装 PAIR,准备好推理引擎。 普通用户直接走 GitHub Releases 的签名安装包就行。PAIR 支持 Ollama 和 LM Studio,你原本用哪个就走哪条路,路径最短。

第三步,本机先发一个测试请求。 官方 playbook 给的是 OpenAI 兼容接口的 curl:

bash
curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen3.6:35b","messages":[{"role":"user","content":"用一句话解释什么是本地 AI 路由器"}]}'

先别管答案聪不聪明,重点是看 Jobs 面板里有没有记录下这次活。

第四步,配对第二台可信设备。 到 Cluster 设置里加同一局域网内的机器,走 6 位 PIN 配对。这一步只适合家里或办公室这种可信网络——公共 Wi-Fi、陌生共享网络就别折腾了,安全边界不是拿来凑热闹的。

第五步,用并发任务看分工。 同时开两个本地请求,或者让一个 Agent 拆出几个独立子任务,观察 Jobs、GPU/内存状态和响应时间。只要看到不同节点在接不同请求,这次试验就算成功。

一个必须提前知道的成本:PAIR 只把请求路由到已经存有该确切模型的节点。想让三台机器都能接 Qwen 3.6 35B 的活,这个模型就得在三台机器上都存一份——按 Q4 量化约 20GB 算,三份就是 60GB,而且随模型数和节点数成倍增长。这不是设计缺陷(不切分请求对家庭硬件是正确的取舍),但你得提前给硬盘做预算

进阶

我把 PAIR 的定位想清楚了:它是本地 AI 的并发加速器,不是大模型扩容器。

用之前先问自己一句——你现在的瓶颈,是"模型装不下",还是"任务排太长"?前者它无能为力,后者它可能今天就能让你舒服很多。

一个清醒的建议:先在可信局域网里拿无敏感数据跑通工作流,别一上来就接生产数据。只要一个工具能碰到你的文件、提示词和上下文,权限就得当成正经事办。

另外,PAIR 目前是 Beta,调度策略只有一套,而且它看不见显存余量、分不清 GPU 档次、不知道模型是不是已经预热好了。这些都不难补,但今天的版本里它们还不存在。

最后,本地 AI 不一定非要从买新硬件开始。有时候,先让你手边那些闲置的机器别再各忙各的,就已经很香了。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区