你家有多少算力在睡觉?
想象一个很普通的场景。客厅的游戏台式机插着一张 RTX 4070,书房的笔记本是去年换的 MacBook Pro M4,角落里还有一台退役的旧台式机,装着块 RTX 2060,偶尔给孩子写作业用。三台机器,三张还算得上能用的显卡或芯片。
但大部分时间,它们什么都没干。
游戏台式机一天真正打游戏的时间可能不到两小时。MacBook 合上盖子充电的时间比打开的时间长。旧台式机更不用说,一周开机不超过三次。这些机器里的 GPU 拥有可观的并行计算能力,是专门为高强度数学运算设计的芯片,此刻却在以接近零负载的状态安静地发着热。
这不是个别现象。全球数以亿计的消费级 GPU 以同样的方式闲置着。如果你试过在本地跑 AI 模型,比如用 Ollama 加载一个 70 亿参数的语言模型做私人助手,你会立刻撞上一堵墙:单张消费级显卡的显存和算力,跑小模型勉强够用,稍微大一点的模型就开始卡顿,再大就根本塞不进去。
这个矛盾很荒谬:你家里明明散落着好几份算力,但它们各自为政,互不相通。你的 AI 只能被困在其中一台机器里,饥一顿饱一顿。
2026 年 9 月 3 日,NVIDIA 在柏林 IFA 大会上给出了一个直截了当的回答:把它们连起来。
PAIR:给家庭算力装一个总调度
NVIDIA 发布的这个工具叫 PAIR,Personal AI Router,个人 AI 路由器。名字听着像个硬件,其实是一套免费、开源的软件。它做的事情用一句话就能说清楚:把你家庭网络里的多台电脑连成一个算力池,在它们空闲的时候,汇集所有闲置的 GPU 算力来跑本地 AI 推理。
具体来说,你在家里的每台电脑上安装 PAIR 客户端,Windows、Linux、macOS 都支持,然后用一个六位数的配对码把它们绑在一起。配对完成后,这些设备之间会建立 mTLS(双向传输层安全)加密通道,所有数据传输都在这条加密线路里走。从这一刻起,你的家庭网络里就多了一个隐形的”AI 算力调度中心”。
当你向本地 AI 发出请求时,比如让它帮你分析一份长文档、生成一段代码、或者跑一个多步骤的智能体工作流,PAIR 不再把任务死死压在一台机器上。它会把任务拆开,分配到当前空闲的多台设备上并行处理。你的游戏台式机、你的笔记本、那台角落里的旧机器,同时出力。这里有一个设计细节值得留意。PAIR 只在设备空闲时征用算力。如果你正在台式机上打游戏,它会自动让出那台机器的 GPU,把负载转移到其他节点。你关掉游戏、机器重新空闲了,它又会悄悄把这份算力接回来。设备随时可以加入或退出网络,PAIR 会自适应调整,不需要你手动干预。
兼容设备的范围比你想象的宽:NVIDIA GeForce RTX 20 系及更新的显卡都能用,也支持 RTX Pro 专业显卡和 DGX Spark 系统。苹果这边,M4 及更新芯片的 Mac 也可以加入。换句话说,过去三四年买的主流电脑,大概率都能参与。
PAIR 的 beta 版从发布当天起就可以下载使用。
不是又一个”分布式计算”的老故事
看到这里,你可能会想:这不就是当年 SETI@home 那一套吗?把全世界的闲置电脑连起来找外星人信号,或者折叠蛋白质?
表面上像,骨子里完全不同。
SETI@home 和 Folding@home 那一代分布式计算项目,处理的是可以完美切割的批处理任务:把一个巨大的数据集切成百万份,每台电脑领一份回去算,算完交回来拼起来就行。任务之间几乎不需要通信,对延迟也不敏感,慢一点无所谓。
但 AI 推理,尤其是现在越来越流行的 agentic 工作流,完全是另一种负载模式。一个 AI 智能体在执行复杂任务时,比如“帮我调研这五家公司的财报,对比它们的现金流趋势,然后写一份投资分析报告”,它会把任务拆成一连串子步骤:搜索、提取、计算、比较、撰写。这些子步骤之间有依赖关系,有的可以并行,有的必须串行,而且每一步都需要快速响应,因为下一步在等着上一步的结果。这种依赖和低延迟的要求,正是老一代分布式项目从没面对过的。
这种负载模式恰恰是 PAIR 瞄准的场景。它的调度不是”把一个大任务切碎扔出去等着收”,而是在本地局域网内(延迟极低,通常不到一毫秒),动态地把多个并发请求分散到不同设备上处理。当你的 AI 智能体同时发出五个子任务时,五台闲置设备各接一个,比全压在一张显卡上要快得多。单张 GPU 不再是瓶颈,因为瓶颈被分散了。
这也解释了为什么 PAIR 选择了”局域网”而不是”互联网”作为连接范围。跨互联网的分布式推理面临延迟、带宽、信任三重难题,而家庭局域网天然解决了前两个,第三个用配对码加 mTLS 就够了。这不是一个宏大的全球算力网络的愿景,而是一个极其务实的局部方案:先把你自己家里的算力用起来。
为什么是”本地”,而不是全部上云?
这个问题绕不开。
2026 年的 AI 使用格局里,云端推理仍然是绝对的主流。OpenAI、Anthropic、Google 的 API 背后是成千上万张 H100 和 B200 组成的数据中心,算力近乎无限,随叫随到。普通用户每月花十几二十美元订阅一个 ChatGPT Plus 或 Claude Pro,就能用上地球上最强大的模型。既然云端这么方便,为什么 NVIDIA 要花力气做一个”让你在家里跑 AI”的工具?
答案藏在两个正在发生的趋势里。
第一个趋势是模型在变小、变快、变便宜。就在 PAIR 发布的同一时期,多个厂商密集推出了可以在消费级硬件上流畅运行的开源模型。NVIDIA 自家的 Nemotron 3.5 Lightning 只有 300 亿参数,但在多个基准测试上逼近了更大的模型。Qwen3.8 系列、DeepSeek v4 Flash 也是类似思路:在保持能力的前提下把模型压到消费级 GPU 能承受的大小。这里还有一件事很关键:NVIDIA 宣布对 llama.cpp 和 vLLM 这两个最流行的本地推理框架进行了深度优化,在 RTX GPU 上最高可以实现 1.9 倍的推理加速,这意味着同样一张显卡,跑同样的模型,速度几乎翻倍。这些优化已经集成到了 LM Studio 和 Ollama 等常用工具中。
当模型小到能在一张 RTX 4060 上流畅运行,当推理框架的效率还在持续提升,”本地跑 AI”就不再是极客的玩具,而是一个真实可用的选项了。PAIR 在这个时间点出现,是在把”可用”推向”好用”:你不需要把所有负载压在那一张 4060 上,你可以把家里其他机器的闲置算力也拉进来。
第二个趋势更微妙,但可能更重要:隐私。
云端 AI 意味着你的所有输入,你的问题、你的文档、你的代码、你的照片,都要上传到别人的服务器上去处理。对大多数日常使用来说这不是问题,但有一些场景天然敏感:医疗记录、财务数据、私人日记、公司内部文档、个人照片的 AI 分析……这些东西你可能不太想交给任何一家云服务商,不管它的隐私政策写得多漂亮。
本地推理天然解决了这个问题:数据从头到尾不出你家大门。而 PAIR 让本地推理的能力上限大幅提高:不是一台机器的算力,而是你家所有机器的算力之和。对于需要处理敏感数据的 agentic 工作流来说,这可能是目前最务实的方案:既有足够的算力跑复杂任务,又完全不依赖外部服务器。
NVIDIA 在 IFA 上把这次发布放在”让前沿智能走向本地”的战略框架下,不是随便选的措辞。同期宣布的 RTX Spark 迷你 Windows PC(联想、宏碁将在十月推出),也是同一战略的另一块拼图:专门为本地 AI 设计的小型主机,可以作为 PAIR 网络中的一个专用节点。
NVIDIA 的算盘:不只是卖显卡
如果只看表面,PAIR 是 NVIDIA 在做好事:免费、开源、让你更好地利用已有硬件。但世界上没有纯粹的利他主义,尤其在商业世界里。
PAIR 背后的商业逻辑其实不复杂:它让你手里每一张 NVIDIA GPU 都变得更有用了。
过去你买一张 RTX 4070 Ti,最多打打游戏、剪剪视频。现在它还能在你不用的时候变成一个 AI 推理节点。更重要的是,PAIR 创造了一个”越多越好”的正循环:你家的 PAIR 网络里每多一张 GPU,整个网络的能力就上一个台阶。那台退役的旧电脑?别扔,装个 PAIR 还能继续发挥余热。要不要再买一张 RTX 5060,专门放在那当 AI 节点?这个念头一旦种下,就很难拔掉。
从更宏观的角度看,NVIDIA 正在用 PAIR 构建一个本地 AI 生态系统。数据中心的生意当然赚钱(NVIDIA 靠卖 H100 和 B200 给云厂商赚得盆满钵满),但数据中心的钱最终流进了 AWS、Azure、Google Cloud 的口袋,NVIDIA 只是上游供应商。而本地 AI 生态不一样:如果消费者和开发者养成了”在本地跑 AI”的习惯,他们就会持续购买和升级消费级 GPU。这是一个 NVIDIA 可以直接触达终端用户的市场,不需要通过云厂商中转。
PAIR 的开源属性也耐人寻味。开源意味着社区可以在上面构建更多工具和集成,比如把 PAIR 和 Home Assistant 连起来做智能家居推理,或者和 VS Code 插件集成做本地代码助手。生态越繁荣,对 NVIDIA GPU 的需求就越刚性。这和 CUDA 当年的策略如出一辙:免费给你用,但你用着用着就离不开了。
不只如此,Apple M4 芯片的兼容支持。NVIDIA 显然不想让”我家没有 N 卡”成为不用 PAIR 的理由。让 Mac 也能加入网络,一方面扩大了用户基数,另一方面也是在说:即使你有 Mac,你还是需要一台带 N 卡的机器来扛主力推理。Mac 可以当配角,主角还得是 GeForce。
对普通人意味着什么
坦率地说,PAIR 的 beta 版对真正的”普通人”来说门槛还是高了一些。你得知道什么是本地 AI 推理,得装过 Ollama 或者 LM Studio 之类的工具,得愿意折腾配对和配置。这不是一个”开箱即用”的消费产品,至少现在还不是。
但它降低的是另一种门槛:算力门槛。
以前你想在本地跑一个像样的 AI 模型,要么忍受一张消费卡的局限,要么花大钱买一台工作站级别的机器。现在你有了第三个选项:把家里已有的几台普通电脑连起来,凑出一个远超单机的算力池。不花额外的钱,不需要额外的硬件,只需要装一个软件。
对开发者来说,PAIR 的价值更直接。如果你在开发需要本地推理的应用,私有化部署的企业助手、离线可用的翻译工具、隐私优先的文档分析服务,PAIR 让你的测试和开发环境直接从”一台开发机”升级到”一个小型集群”。你可以在接近真实部署环境的条件下测试 agentic 工作流的并发性能,而不需要去云上租一堆 GPU 实例。
没那么美好的部分
当然也有显而易见的局限。
家庭网络的稳定性和带宽是个问题。Wi-Fi 环境下的延迟抖动、设备随时可能被关机或被占用、不同设备之间的性能差异,这些都会给调度带来复杂性。PAIR 宣称能自适应处理设备的加入和离开,但在实际的复杂家庭网络环境中,这种自适应到底有多可靠,需要时间来验证。
另一个问题是能耗。把原本休眠的设备唤醒来做 AI 推理,意味着额外的电费。一张 RTX 4070 满载功耗在 200W 左右,三四台机器同时跑起来,电表的转速不会让你无感。对于只是偶尔跑一下本地 AI 的用户来说,这笔账不一定划算。
最后,PAIR 目前解决的是”推理”而不是”训练”。你不能用它来微调模型,不能用来做 RAG 的向量化索引构建,它的适用范围是有边界的。
一块拼图,不是全部答案
把 PAIR 放到更大的图景里看,它的意义不在于”今天能帮多少人”,而在于它指向的方向。
过去几年,AI 的算力分布高度集中。几家云巨头和少数大模型公司控制着绝大部分的推理和训练资源。你想用 AI,就得把数据交出去,把钱交出去,然后在别人的服务器上,用别人训练的模型,在别人规定的使用条款下,得到一个结果。
PAIR 代表的是一股反向的力量:算力去中心化。不是说要取代云端(那不现实,大型模型的训练和最顶尖的推理能力短期内仍然是数据中心的专属),但日常的、个人化的、隐私敏感的 AI 使用场景,完全可以回到本地。当模型在变小,当推理框架在变快,当家庭里的闲置算力通过一个软件就能被有效聚合,本地 AI 的实用性正在跨过一个临界点。
NVIDIA 赌的就是这个临界点。如果它赌对了,PAIR 会成为一个基础设施级别的存在,就像你家的 Wi-Fi 路由器一样,你不太会注意到它,但它无处不在。到那时候,”你家有几台设备在 PAIR 网络里”可能会变成和”你家宽带多少兆”一样自然的问题。
不过,赌对不代表赢。微软、苹果、高通都在各自的 AI PC 战略上大举投入,Google 有 TPU 和自家的端侧推理方案,开源社区也在探索不依赖特定硬件的分布式推理框架。PAIR 的先发优势能持续多久,取决于它的开源社区能不能真正活跃起来,以及 NVIDIA 愿意在这个”不直接赚钱”的项目上投入多少持续的工程资源。
但至少在今天,PAIR 做对了一件事:它让人意识到,你家里的那些沉默的机器,并不是只能用来积灰的。它们的 GPU 里沉睡着的算力,第一次有了一种简单的方式被唤醒、被连接、被用起来。
这件事本身,就值得关注。



