← 返回新闻列表
InfoQ AI 🗓️ 2026-09-05

Meta 拓展自研芯片战略:从计算领域延伸至网络领域,这一消息引发行业关注

⚡ 一句话看懂:Meta 拓展自研芯片战略:从计算领域延伸至网络领域,这一消息引发行业关注。来源:InfoQ AI。

Meta 详细介绍了 MTIA 300,这是其首款专为训练排序和推荐模型而优化的自研加速器。

大语言模型训练往往主要关注原始浮点算力吞吐量——Meta 表示,与之不同的是,推荐模型在加速器之间的通信上花费了更多时间。

MTIA 300 通过将网络和集合通信直接集成到芯片中来解决这一问题。

通信压力主要来自嵌入表,Meta 表示,嵌入表可能包含推荐模型 99% 以上的参数量。

在数百个加速器上训练这些模型会产生频繁的 AllReduce、AllToAll 和 AllGather 操作,从而形成一种网络与计算本身同等重要的工作负载。

Meta 首先将网络接口移入加速器封装内部。

MTIA 300 包含两个网络芯粒,每个芯粒配备六个定制的 800 Gbps RDMA NIC,提供总计 1.2 TB/s 的 I/O 带宽,且无需经过 PCIe 总线。

这十二个 NIC 同时支持机架内的纵向扩展通信和机架间的横向扩展流量,让 Meta 能够在无需重新设计芯片的情况下调整带宽分配方式。

来源:Meta 将 NIC 移近计算端并未消除另一个资源争用问题:在传统 GPU 上,集合通信会占用训练任务本身所需的计算资源。

而 MTIA 300 则配备了 16 个专用的消息引擎,独立于主计算网格处理通信,其中包括用于归约操作的近内存硬件。

Meta 表示,这种分离使得大型矩阵运算和集合通信能够并发运行,计算吞吐量仅下降不到 0.5%。

而作为对比的 GPU 架构,在两类工作负载同时运行时,实测算力损耗超过 20%。

该硬件与 HCCL(Meta 的集合通信库)进行了协同设计。

与在作业运行时由主机 CPU 编排每一次通信操作不同,HCCL 将集合操作编译为子图,MTIA 300 的消息引擎可以自主执行这些子图。

一旦这些指令到达加速器,主机便不再参与驱动通信。

Meta 表示,在生产环境下,HCCL 在单个机架内可实现最高 940 GB/s 的通信带宽。

针对一个部署在 40 个加速器上的 1500 亿参数推荐模型,MTIA 300 相比同等配置的 GPU 集群将总通信耗时降低至原来的 1/3.9(通信时间减少 3.9 倍)。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接