← 返回新闻列表
InfoQ AI 🗓️ 2026-09-10

刚刚,推理成为新中心、Agent把生产级问题提前:AI Infra 的边界正在被重写

⚡ 一句话看懂:刚刚,推理成为新中心、Agent把生产级问题提前:AI Infra 的边界正在被重写。来源:InfoQ AI。

过去几年,AI 行业最受关注的问题往往集中在模型本身:参数还能做多大,训练需要多少 GPU,新模型又刷新了哪些 Benchmark。

但当越来越多企业真的开始把 AI 放进生产系统,问题就变了:GPU 不再只有一种,模型训练和推理之间的边界越来越模糊,推理系统需要同时处理 KV Cache、Prefill、Decode 等不同负载,Agent 又开始主动产生大量并行、难以预测的请求。

过去十多年,云计算和云原生社区一直在努力把基础设施做得更标准、更统一,AI 却重新把大量差异带回了系统。

这也是今年 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026 最明显的一个变化: CNCF、OpenInfra 与 PyTorch 三个过去分处不同技术层的开源社区,第一次在同一场行业大会中同台。

这不只是一次活动层面的合并,而更接近企业实际部署 AI 时使用开源技术的方式:模型、编排和底层基础设施,本来就很难彼此独立。

几个社区也因此开始更直接地处理同一套生产系统里的接口、协同和边界问题。

在 Keynote 结束后的媒体发布会上,OpenInfra 基金会总经理 Thierry Carrez(阚雷)、CNCF 执行总监 &Linux 基金会云与基础设施执行总监 Jonathan Bryce(傅兰石)、PyTorch 基金会执行总监 Mark Collier(柯理怀),以及 CNCF 首席技术官 &Linux 基金会云与基础设施 CTO Chris Aniszczyk,与 InfoQ 等媒体展开了进一步交流。

他们都在反复强调同一件事:AI 真正进入生产环境之后,原来的基础设施能力还远远不够。

AI 把云时代努力消除的“差异”又带回来了 Thierry Carrez 直接表示:“无基础设施,不 AI。

”(原话:There is no AI without infrastructure.) 模型、推理服务、Agent,最后都要落到计算、加速器、网络和存储上运行。

但 AI 带来的基础设施要求,和传统云工作负载已经明显不同。

一方面,GPU 和各种加速器越来越多样,企业需要把异构资源组织成统一资源池;另一方面,GPU 本身价格高昂,利用率不能像普通服务器一样“够用就行”,而是需要尽可能压榨到接近满负载。

与此同时,Agent 的出现又把隔离和控制问题推到了更前面。

Jonathan Bryce 提到,云计算过去十几二十年的一个核心方向,是尽量把环境标准化,再通过 API 动态访问资源,但 AI 正在重新把异构性带回基础设施。

为了充分释放 AI 系统的性能,企业会使用定制硬件、定制 Kernel;从芯片一直到 Agent,各层之间的联系也变得更紧密,没有一个单独的开源项目能够覆盖从芯片到 Agent 的整条技术链路。

这种变化甚至已经深入到单个 AI 请求内部。

一个 AI 负载可能需要把不同任务交给不同类型的硬件:KV Cache 可以放在内存,也可能卸载到高速存储;Prefill 和 Decode 阶段的资源特征也不同。

基础设施面对的已经不只是“把一个 Pod 调度到一块 GPU 上”,而是要理解请求内部不同阶段的资源需求,再决定这些任务该落在哪种计算、存储和网络资源上。

第二个变化来自 Agent。

传统互联网服务的大量请求由人触发:点击、输入、提交表单,行为模式相对可预测;Agent 则可以自己拆任务、调用工具、并行发起请求,工作负载的形态完全不同。

Jonathan 认为, Agent 正在产生并行度更高、资源需求呈指数级增长的工作负载

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接