← 返回新闻列表
InfoQ AI 🗓️ 2026-09-19

深度解读:单个机柜到底能跑多少个 Agent?答案不在 GPU 身上

⚡ 一句话看懂:深度解读:单个机柜到底能跑多少个 Agent?答案不在 GPU 身上。来源:InfoQ AI。

过去几个月,大厂接连发布了新一代基础模型。

Claude Fable 5.1、Gemini 3.8 Flash 与 GPT-6 Astra 等层出不穷。

不难看出,这些模型几乎都在追求 Agent 的适配能力,让整个推理时间更长,工具调用更顺,决策链条也更稳。

这也让 Agent 加速进入企业端。

数据显示,2026—2027 年,中国企业场景中的活跃智能体(Agent)数量单年同比增长超 200%,到 2031 年预计可达到 3.5 亿个。

值得注意的是,这种全民狂欢的背后,数据中心正面临巨大的挑战。

现有数据中心基础设施,基本都是为大模型单次推理调用的吞吐量而设计的,并未真正考虑过 Agent 那种高频、突发、有状态,并且工具调用穿插其中的工作负载。

谷歌最近的调研提出,近 83% 的企业高管认为基础设施需要为 Agent 时代重新调整。

前不久,AMD 也表示 CPU 和 GPU 的配比要重新调整;8 月,AWS 和 NVIDIA 更是宣布,要联手搞下一代 AI 基础设施。

然而,这些说法更多是围绕输入端的能力参数——比如有多少核心、多少带宽、在功率上限下能运行多少节点。

英特尔在 8 月发布的一份白皮书中,却表明了不同的立场。

英特尔提出,对数据中心进行优化的关键,并不在于提升理论参数值,而是考虑它在实际应用场景下,满足延迟承诺时,能够维持多少 Agent 的任务量。

一句话说就是:“去计算数据中心的实际工作量,而不是理论的性能上限。

” 这是一个系统级的论点。

对于还在摸索 Agent 生产到底需要什么基础设施的行业来说,不失为值得认真对待的思路。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接