技术

Nvidia PAIR将家中GPU连成集群,AI代理速度翻倍——完全免费

Susan Hill

英伟达推出了一款名为PAIR(Personal AI Router,个人AI路由器)的免费新工具,它可以将AI代理任务分配到家庭网络中的多台电脑上,把你的游戏PC、工作站甚至Mac电脑集合成一个统一的推理集群。原理其实很简单:大多数运行AI任务的电脑大部分时间都处于闲置状态,而本地AI工作负载越来越依赖于能够同时生成数十个独立子任务的代理。PAIR正好将这些闲置算力串联起来。

该软件作为一个透明代理运行在Ollama和LM Studio这两款最流行的本地推理工具之上,因此现有设置无需更改任何代码。在每台机器上安装后,PAIR会使用mDNS——也就是打印机用来在网络中自动出现的同一协议——自动发现兼容设备。主代理照常提交任务,PAIR会根据每台机器已加载的模型来决定哪个子任务交由哪台机器处理。不同机器无需相同配置:一台运行Llama 3.3的游戏PC和一台搭载Mistral的笔记本电脑可以协同完成同一项任务。

英伟达公布的基准测试让差异一目了然:一个包含五个子代理的任务在单台RTX Spark笔记本电脑上需要18分钟完成,而在三台设备组成的集群中耗时仅8分48秒。这意味着在不改一行代码、不支付任何云端算力费用的情况下,实现了约两倍的速度提升。增益幅度随着机器数量和任务性质而变化——那些能拆分成大量并行片段的任务受益最大。

隐私是另一个卖点,而且是一个更持久的卖点。每一条提示、每一个文件、每一段代理上下文都留在你的家庭网络中。没有任何内容被路由到云端推理服务;没有API密钥,没有用量计量,也没有任何公司接收你的查询。对于任何在敏感文件——法律草稿、医疗记录、私人通信——上运行代理的人来说,这一区别比基准测试数字更重要。

但限制也是实实在在的。PAIR不提供任何服务质量保证:如果你依赖的那台机器突然启动GPU运行游戏或视频导出,PAIR会将工作负载重新分配给其他可用设备。该工具明确面向运行时间较长、截止时间灵活的任务,而非要求延迟可预测的应用场景。此外,它目前仍是测试版软件。英伟达将目标瞄准那些至少拥有一台兼容设备(GeForce RTX 20系列或更新的显卡,或苹果M4系列芯片)的发烧友,并且默认他们已经熟悉Ollama的使用方式。

PAIR是免费、开源的,目前已在Windows、macOS和Linux上提供测试版。英伟达尚未公布关于QoS保证或稳定版发布日期的路线图。要从中受益,实际门槛是至少两台具备足够算力的设备,这排除了大多数单机用户。对于已经在家里的多台设备上运行Ollama的用户来说,入场门槛低到足以一试。

标签: , , , , ,

讨论

有 0 条评论。