NVIDIA Personal AI Router 将 AI 任务分配到本地计算资源上

NVIDIA 推出 Personal AI Router(PAIR)测试版,可把本地网络中多台机器的推理能力整合起来,自动分配 AI 请求,缓解单个 GPU 在多代理负载下的瓶颈。

一句话看懂:NVIDIA 推出 Personal AI Router(PAIR)测试版,可把本地网络中多台机器的推理能力整合起来,自动分配 AI 请求,缓解单个 GPU 在多代理负载下的瓶颈。

事件核心:发生了什么

NVIDIA 发布了 Personal AI Router(PAIR)测试版。它的定位不是把多块 GPU 或显存合并成一个大加速器,而是把一个个独立的推理请求调度到本地网络中合适的节点上执行。PAIR 可与 Ollama、LM Studio 等本地推理服务集成,且不需要改动底层架构或代理框架——智能代理照旧连接自己熟悉的本地接口,PAIR 在后台识别引擎和模型要求、选择符合条件的主机、转发请求并回传结果。

NVIDIA 给出的演示把 Hermes Desktop、Ollama 与 PAIR 结合,用 RTX Spark、DGX Spark 和 RTX 5090 组成节点池,完成同一负载的耗时约为单台 RTX Spark 笔记本的一半。演示中 Hermes 把任务拆成五个专项分析分派出去,再整合结果。NVIDIA 同时强调,该数据依赖工作负载并行度、模型、引擎设置、硬件、网络和节点可用性,不应视为性能保证。

为什么重要

广度优先的智能代理模式正在变常见:主代理把子任务分给子代理,或多个代理协作处理复杂任务。这种模式下请求数量容易在本地单卡上堆积成瓶颈。PAIR 补的是调度层这一环,而不是算力硬件本身,意味着本地多代理工作流可以更充分地利用已有设备。它支持 Windows 11、Linux 和 macOS,覆盖 x64 与 arm64,也能混合不同操作系统的节点。不过公告在社交媒体上引发了一些误读,部分用户把它理解成对外共享算力或靠拼凑低性能设备跑大模型的方案,这与 NVIDIA 的说明并不一致。

对用户/开发者/创作者的影响

对本地部署大模型、跑图像生成或多代理流程的开发者来说,PAIR 提供了一种低改造成本的横向调度方案:不必重写代理逻辑,就能把重复性推理任务摊到多台机器上。Reddit 用户 Vegetable-Warthog81 提到,他用 PAIR 把任务分给三块通过 Ollama 运行 Qwen 3.8 27B 的 RTX 5090,更看重稳定性与 GPU 满载率而非单机峰值吞吐,实际表现不错。对创作者和企业采购而言,现有设备有机会被更充分利用,但目前公开信息显示它不会提升单模型的最大参数规模。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 PAIR 正式版是否进入更成熟的生产可用状态,调度策略和节点健康检查如何演进;二是它能否扩展到更多推理引擎和代理框架,形成开发者生态;三是若需跨机拆分超大模型,Petals、Mesh LLM(配合 Skippy)等方案仍是另一条路线,二者定位差异值得对比观察。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 24927

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注