Agent 时代,哪些方向正在成为行业关键变量?
50 + 实战案例揭晓答案!
模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。
当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么?
答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。
在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。
本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。
阿里巴巴 Qwen 团队算法工程师章程瑞东已确认出席 “AI Infra、推理工程与异构计算” 专题,并发表题为《面向 Qwen 系列模型线性注意力的高性能优化实践》的主题分享。
自 Qwen-3.5 采用混合注意力结构以来,Qwen 系列模型的线性注意力层 Gated Delta Network(GDN)在训练与推理中的开销日益显著。
现有实现面临两大难题:一是多步算子需要反复读写 HBM,访存瓶颈严重;二是状态递推的串行性使算子并行度受限于注意力头数,在长序列、小 batch 或 TP 场景下 GPU 利用率低下。
为此,他们提出 FlashQLA —— 基于 TileLang 的高性能线性注意力算子库。
核心方案包括:将 GDN Chunked Prefill 的前向与反向流程各拆分为两个融合算子,通过数据复用降低访存开销,并在算子内通过 warp-specialization 实现不同计算的重叠;基于门控衰减的自动化卡内序列并行,并建立数学模型动态调节并行粒度;针对具有指数衰减特性的注意力头,舍弃昂贵的修正矩阵计算,改用轻量级预热获得精确状态。
在 Hopper 显卡上,FlashQLA 相比 FLA Triton kernel 实现前向 2–3 倍、反向 2 倍加速,且在 TP 增大时加速比持续提升,显著优化了预训练与端侧推理效率。
在本次演讲中,章程瑞东将对此展开详细介绍。
章程瑞东,阿里 Qwen 团队算法工程师,主要工作领域为线性注意力与稀疏注意力的算子-算法联合优化,在 Qwen 3.5 及后续模型的预训练与后训练过程中提供相关 infra 支持。
曾就职于微软亚洲研究院,参与稀疏注意力优化算法 MInference(Neurips'24) / MMInference(ICML'25) / MTraining(MLSys'26),上下文窗口拓展算法 LongRoPE(ICML'24)、分布式 LLM 服务系统 ParrotServe(OSDI'24) 等,并参与 Phi-3 系列模型研发。
近期主导开发了 GDN Chunked-Prefill 优化方案 FlashQLA,在 Qwen 系列混合注意力模型的训练和推理场景下均有显著的加速效果。
他在本次会议的详细演讲内容如下: 演讲提纲: 1.
背景与挑战 Qwen 模型训练与推理 Prefill 过程中 GDN 模块的耗时 性能瓶颈剖析: 访存密集型:分步 kernel 大量读写 HBM,中间变量开销大
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜