AREX Feed Article
NVIDIA PAIR 公测:自动发现局域网 PC 并按余量分发推理请求
NVIDIA 于 9 月 3 日(UTC;北京时间 9 月 4 日凌晨)发文,宣布在 IFA 2026 推出 NVIDIA PAIR(Personal AI Router,个人 AI 路由器)公测版:一款免费开源的软件工具,能自动发现本地网络上的兼容 PC,并把 AI 推理请求分发给当时算力有余量的系统。博客称,公测覆盖 Windows、macOS 与 Linux 三平台,图形界面与终端界面均可使用,兼容 Ollama 与 LM Studio 两款常用的本地推理工具。
PAIR 是 NVIDIA 与微软及其合作伙伴在 IFA 2026 公布的“本地 AI”更新之一,同批宣布的还包括:经 llama.cpp 与 vLLM 新优化的本地推理提速,Hermes Agent、OpenClaw 与 Perplexity Portable Computer 的本地模型设置简化,以及联想与宏碁定于 10 月上市的 NVIDIA RTX Spark Windows PC。以下功能描述与性能数字均出自 NVIDIA 官方博客及其产品页,属于厂商单方口径。
子任务不必再挤在同一张 GPU 上排队
博客称,agent(智能体)工作流常把复杂任务拆成可以并行的子任务,但当每个请求都竞争同一张 GPU 时,速度就会慢下来。PAIR 的应对是自动发现局域网内兼容的 PC,把相互独立的请求分发出去,并在设备加入或离开网络时自动适应。
补充了工作方式:应用与 agent 把推理请求发给 PAIR 暴露的单一本地端点,由它代理转发到可用节点。各设备仍是独立系统、并行处理各自的任务,PAIR 不会把多台 PC 合并成一块虚拟 GPU。
隐私与离线的处理:提示词、文件与 agent 上下文留在用户本地网络,不上传云端推理服务;运行本身不要求联网,只有下载模型时需要。
PAIR 公测支持 GeForce RTX 20 系列及以上显卡、RTX PRO 工作站 GPU(Turing 架构及更新)、DGX Spark 与 Apple M4 或更新芯片的 Mac。产品页列出的最低要求是 8GB 内存、推荐 20GB 以上磁盘空间,三个平台均提供 x86 与 ARM 安装包。
过半美国家庭有两台以上 PC,白天大多闲着
博客给出的背景是:超过半数的美国家庭拥有两台或以上 PC,其中大部分算力在白天处于闲置。PAIR 想把这些系统变成一台“个人推理集群”。
博客举的例子是:用户让 Hermes 制定一份「Sunday Reset」计划,把塞满的收件箱分拣一遍,标出哪些要立即处理、哪些可以等、哪些直接略过。Hermes 可以把这项工作拆给多个子代理,PAIR 再把子任务分发到多台可用的 PC。博客页面还嵌入了一段题为“NVIDIA PAIR: Hermes 5-Subagent Demo”的演示视频。
结果是:本地 agent 能并行跑更多任务,主系统在打游戏或做创作时可以把 AI 负载挪到另一台 PC 上继续跑。
llama.cpp 与 vLLM 新优化:吞吐最高 1.9 倍
按博客的说法,llama.cpp 通过内核优化、增强的投机解码(speculative decoding)与更快的 prefill,在 GeForce RTX 5090 上把吞吐最高提升至 1.9 倍。
vLLM 在 RTX PRO 6000 Blackwell 工作站版上提升至 1.2 倍,在双 DGX Spark 集群上最高提升至 1.4 倍,依托 FlashInfer 中新的 XQA 注意力内核与后端优化。
这些提升可以直接通过 llama.cpp 与 vLLM 两个后端获得,也可以经由 LM Studio 与 Ollama 应用体验。
Hermes、OpenClaw 与 Portable Computer 简化本地模型配置
博客称,以往在本地跑 agent 要自己选模型、找兼容的推理服务器、调量化设置并持续更新;在 RTX 与 DGX 系统上,这类摩擦正在消失。
Nous Research 开发的 Hermes Agent 在 Windows 上提供一键设置:自动检测 NVIDIA GPU、选择合适的模型与配置,并通过内置的 llama.cpp 直接运行,免去手动下载模型与调参,Linux 支持稍后到来。
GitHub 上 star 数超过 38 万、被 NVIDIA 称为“最大 AI 项目”的 OpenClaw,则由 NVIDIA、微软与 OpenClaw 三方合作为 Windows 推出简化设置,面向显存 24GB 及以上的 RTX GPU。
Perplexity 上个月推出的 Portable Computer 也在名单里:目前支持 Linux 系统上显存 24GB 及以上的 RTX GPU,Windows 支持即将到来。用户可以完全在本地跑完工作流、不消耗云端额度,只在需要额外研究或推理时,经许可把部分任务升级到 15 款以上云端前沿模型。
IFA 上的 RTX Spark:宏碁概念机与联想两款 Yoga
宏碁在 IFA 展出了紧凑台式机概念,联想宣布了 Yoga Pro 9n 与 Yoga 9n 二合一两款新机。RTX Spark 采用 1 Petaflop 算力的 RTX Blackwell GPU、最高 128GB 统一内存与 20 核 Grace CPU,博客称它与新的 Windows Agent 框架配合,可让 agent 在操作系统级管控下安全地后台常驻。
游戏生态同步跟进:EA、Embark 与 Ubisoft 是 Gamescom 上最新一批宣布把大作带到 RTX Spark 的发行商,此前 5 月 COMPUTEX 上已有 KRAFTON、网易、Riot Games 与 Xbox 宣布支持。
随 RTX Spark 在 10 月一同上线的还有 CyberLink 的 PhotoDirector AI PC Mode,在 NVIDIA GPU 上经 TensorRT-RTX 与 FP8 加速本地 AI。除这批 IFA 新设计外,博客称先前公布的六家 OEM 设备也将在 10 月出货。