NVIDIA Personal AI Router(PAIR)推出了测试版, 让你可以整合本地网络中多台计算机的推理能力 ,并自动在它们之间分配 AI 请求。
该技术主要针对本地多代理 AI 工作负载而设计。
在该场景下,多个独立的模型调用可能会导致单个 GPU 不堪重负。
NVIDIA 表示,采用广度优先策略来分配智能代理任务正变得越来越普遍:由主代理将子任务分派给子代理,或者多个代理协同工作以完成更复杂的任务。
然而,当本地 GPU 接收的请求过多时,这种方法可能会造成瓶颈。
为了应对这一挑战, NVIDIA PAIR 通过将单个推理请求分配到可用系统中,最大限度地利用本地可用的 AI 计算资源。
它能与 Ollama 和 LM Studio 等流行的本地推理服务无缝集成,不需要更改底层架构或代理框架。
智能代理可以通过它所熟悉的本地接口发送请求。
PAIR 通过其代理接收请求,识别其引擎和模型要求,并选择一个符合条件的节点。
该节点从头到尾执行该请求,并通过 PAIR 将响应发回。
智能代理仍然只能看到一个连接,而 PAIR 则在后台处理任务调度。
为了展示 PAIR 的功能,NVIDIA 发布
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜