Microsoft 发布了 一个用于在 Azure Kubernetes 服务 上路由智能体流量的参考架构。
它将这个问题分解为三个关键选择:由哪个模型响应调用、如何管理调用,以及由哪个 GPU 副本处理调用。
该设计结合了用于负载均衡的 Kubernetes Gateway API Inference Extension 、作为 AI 代理的 agentgateway
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜 每6小时更新Microsoft 发布了 一个用于在 Azure Kubernetes 服务 上路由智能体流量的参考架构。
它将这个问题分解为三个关键选择:由哪个模型响应调用、如何管理调用,以及由哪个 GPU 副本处理调用。
该设计结合了用于负载均衡的 Kubernetes Gateway API Inference Extension 、作为 AI 代理的 agentgateway
如果你要核对细节,可以再看原文: InfoQ AI原文链接