在大模型能力如此强大的当下,模型背后智能的生产和交付,仍远没有实现工业化。
九章云极副总裁胡宗星给出了一个直观的数据对比:顶级 8 卡 GPU 服务器的聚合内存带宽,理论上支持每秒生成约 1000 个 Token;但在实际工程中,主流推理框架的解码速度往往只有几十 Token/s,中间存在超过 10 倍的性能鸿沟。
这道鸿沟来自推理系统里的“执行间隙”。
GPU 本身并不缺理论算力,但在真实推理链路中,不同计算任务之间会出现等待,通信和计算也很难充分并行。
尤其在解码阶段,单个 Kernel 的执行时间可能只有微秒级,CPU 与 GPU 之间频繁的启动、调度和同步,反而会成为关键瓶颈。
再加上 KV Cache 等推理状态需要在 HBM、DRAM、NVMe 等不同存储层级之间反复搬运 这些都使得算力消耗在等待、同步和数据移动中,而客户最后为这道性能鸿沟买单。
这说明,智能的工业化不能只追求更大的算力规模,也不能只比较更低的 Token 单价。
真正重要的是同样的能源和算力投入,能不能生产出更多有效 Token;同样的 Token 消耗,能不能完成更多业务任务。
因此,AI 基础设施需要同时回答智能如何计量,以及智能如何生产。
“我们正处于智能工业化时代的拐点,但现在,一个更根本、更现实的考验摆在我们所有人面前:时代所需要的不仅是技术突破,更是‘智能生产力’的突破。
”九章云极 DataCanvas 公司创始人、董事长方磊说。
在 6 月 17 日的发布会上,九章云极提出 AI 工厂战略,并发布 Alaya NeW Cloud 3.0。
训练工厂负责把通用智能生产为专业模型,Token 工厂负责把专业模型封装为可调用、可计量、可保障的专业 Token。
与此同时,九章还提出了 DCU 与 Token 的度量体系,以及围绕推理效率、状态复用、跨集群调度和算电协同展开的一系列底层工程设计。
成立 13 年来,九章云极经历了 AI 的多轮浪潮,也走过了 PaaS、云、智算平台的多次转型。
现在,它试图把自己从算力资源提供者,进一步推向智能工业生产者,组织智能的生产、计量、流通和交付。
智能工业化的第一步:统一度量衡
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜