大模型能力持续演进,但 AI 的下一阶段竞争正在发生变化。
模型能力之外,如何构建可靠的智能体、完善 AI 工程体系,并让 AI 在复杂业务环境中稳定运行,正在成为产业探索的新重点。
8 月 21 日-22 日,AICon 全球人工智能开发与应用大会将在深圳举办。
大会全日程现已 100%上线,来自产业一线的技术专家将围绕 Agent 工程化、大模型基础设施、AI Native 研发、具身智能等前沿方向,分享 AI 时代的技术探索与工程实践,共同探讨 AI 从能力突破走向系统构建的新路径。
华为 2012 实验室大模型系统工程技术专家李柏潮已确认出席 “AI Infra、推理工程与异构计算” 专题,并发表题为《盘古训练与推理通信优化实践:亲和昇腾平台的性能探索》的主题分享。
通信开销是大模型训练和推理中不可忽视的性能瓶颈。
在 MoE 模型中,AllToAll 通信占总端到端时间的 30% 以上,是一直以来的优化重点;而 1M 超长上下文场景下,Host to Device 的 KV Cache 传输延迟已成为推理 TTFT 的新“拦路虎”。
深度亲和昇腾硬件进行通信优化,才能最大化将昇腾算力潜能转化为模型训练/推理性能提升。
本次分享围绕昇腾平台的两类通信优化展开:第一部分聚焦 MoE 场景下的 AllToAll,通过适配昇腾 950 的网络拓扑和 CCU 通信加速器,在盘古模型的 EP 通信域 AllToAll 上实现了 10% 以上的性能提升;第二部分关注超长序列推理中的 KV Cache 卸载,通过 Omni Cache 高效的 H2D 和 D2H 通信,实现 TTFT 提升 10 %以上。
更进一步,他们将展望如何通过昇腾亲和实现最优的通算掩盖,使得通信不再成为暴露在训练/推理端到端时延中的短板。
李柏潮,华为 2012 实验室 大模型系统工程技术专家,中山大学博士,在华为长期从事通信协议的研究工作,研究方向覆盖数据中心网络、广域网络、终端无线网络。
当前聚焦优化盘古模型训练/推理的通信性能,主导盘古模型在昇腾 950 上的通信算子性能优化。
他在本次会议的详细演讲内容如下: 演讲提纲: 1.
大模型的训练/推理在通信方面面临哪些技术挑战?
MoE 阶段的 AllToAll 通信是长期以来的关键瓶颈 在超长上下文场景,H2D 通信成为推理场景新出现的性能瓶颈 2.
亲和昇腾硬件,加速 EP 域的 AllToAll
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜