← 返回新闻列表
InfoQ AI 🗓️ 2026-09-19

重磅!从算子调优到推理自治:构建 MaaS 场景下的 AI Inference 自动优化闭环|QCon上海

⚡ 一句话看懂:重磅!从算子调优到推理自治:构建 MaaS 场景下的 AI Inference 自动优化闭环|QCon上海。来源:InfoQ AI。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。

AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。

这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。

模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。

本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

阿里巴巴高级技术专家杨林枫已确认出席 “AI Infra:算力效率决定规模化落地” 专题,并发表题为《从算子调优到推理自治:构建 MaaS 场景下的 AI Inference 自动优化闭环》的主题分享。

MaaS 业务中的模型、硬件和请求工况变化较快。

传统的部署调优和算子优化依赖人工完成需求分析、性能定位、算子开发、验证及上线,优化周期难以跟上生产负载的变化。

本次分享将介绍一套面向 MaaS 生产场景的自动优化流程:给定卡型、模型和典型工况,探索合适的部署配置;从实际运行 Trace 中识别热门算子,并结合当前工况判断是否采用已有的算子融合模式;对典型工况进行归并、清洗、脱敏和泛化,生成可复现的 Benchmark;再由 Atrex Kernel Agent 通过 Agent Loop 完成性能分析、代码生成、验证和持续优化;最后将优化结果回接推理框架,进行端到端性能回归和灰度验证。

分享将重点介绍算子优化,以及各环节之间如何衔接。

杨林枫,阿里巴巴高级技术专家,斯坦福大学博士。

长期从事 AI 软件栈、AI 编译与算子编译工作,是开源 AI 框架 MindSpore 核心贡献者,曾主导昇腾算子编译器 SWFT 的设计与研发。

现聚焦大模型推理、GPU Kernel 自动生成与长周期智能体工程,是 Atrex Kernel Agent 核心研发者,相关实践支撑阿里百炼 MaaS 大规模 GPU 集群的性能优化。

也曾支撑 Qwen3.8 获得 NVIDIA SOL-ExecBench FlashInfer 算子优化榜首。

他在本次会议的详细演讲内容如下: 演讲提纲: 为什么 MaaS 推理优化需要自动化 MaaS 场景中的模型、卡型、请求工况和部署配置持续变化 传统流程依赖人工完成需求分析、性能定位、算子开发和框架集成,整体周期较长 单算子 Benchmark 的优化结果不一定能转化为端到端收益

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接