← 返回新闻列表
InfoQ AI 🗓️ 2026-07-19

三款AI推理芯片+超节点异构集群,云天励飞公布未来算力蓝图,业内人士怎么看?

⚡ 一句话看懂:三款AI推理芯片+超节点异构集群,云天励飞公布未来算力蓝图,业内人士怎么看?。来源:InfoQ AI。

7 月 18 日,云天励飞在 2026 WAIC 公布未来两年多 AI 推理芯片路线图。

公司计划推出 DeepVerse100P、DeepVerse100D、DeepVerse100L 三款芯片,分别针对 AI 推理中 Prefill、Decode 和 Decode FFN 环节的负载特征进行专用优化。

三款芯片将面向万卡异构集群进行协同设计与部署,通过对不同推理阶段进行解耦,为不同负载配置更加适配的芯片和算力资源,进一步提升系统整体效率,持续降低 Token 生成成本。

推理负载持续分化,算力优化走向精细化 从负载特征来看,当前大模型推理应用正在形成不同类型:以对话、知识问答为代表的通用 AI 助手,以复杂推理、编程为代表的深度推理应用,以及以 Agentic Coding、多 Agent 协同为代表的实时智能体系统。

随着 AI 应用不断深入,单次任务的上下文长度、推理链路复杂度以及实时交互要求持续提高,对推理系统的吞吐、延迟和成本提出了更高要求。

对于大规模推理部署而言,峰值算力已难以单独反映系统效率,计算、访存、互联和系统调度等因素,共同影响 Token 生成效率和成本。

大模型推理不同阶段的计算特征也存在明显差异。

Prefill 需要集中处理输入上下文,对计算能力要求较高;Decode 采用逐 Token 生成方式,对内存带宽和数据访问效率更加敏感。

随着 MoE 等模型架构发展,Decode 阶段内部的 Attention 与 FFN 在计算、访存等方面也呈现出不同的资源需求。

针对推理负载的变化,云天励飞计划在未来推出 DeepVerse100P、DeepVerse100D 和 DeepVerse100L 三款云端大算力推理芯片。

DeepVerse100P 面向百万级上下文 Prefill 场景打造。

在传统混部架构中,长上下文 Prefil 与 Decode 共享算力与带宽资源,会造成资源抢占,对 Decode 生成吞吐造成影响。

DeepVerse100D 面向 Decode 环节打造专用推理引擎,拥有数倍于主流芯片的内存带宽,支持 1024 卡 Scale-up 及光互联系统架构。

通过按需建立光路直连,并根据任务动态重构光路,减少传统多跳电交换和静态组网中的排队、拥塞及中间转发开销,降低多节点通信阻塞和尾延迟,提高逐 Token 输出的稳定性。

DeepVerse100L 面向 Decode 阶段计算密集型的 FFN 环节,采用 3D Memory 架构,相比主流 HBM,大幅提升内存带宽,并通过低延迟芯片互联和激活数据快速传输,提高计算与通信的并行效率。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接