Agent 时代,哪些方向正在成为行业关键变量?
50 + 实战案例揭晓答案!
模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。
当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么?
答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。
在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。
本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。
InferactvLLM committer 莫梓峰已确认出席 “AI Infra、推理工程与异构计算” 专题,并发表题为《vLLM 针对多模态模型的推理优化实践》的主题分享。
如今开源大语言模型的迅速发展,随着 Kimi-K2.6、 Qwen3.6 及 cosmos3 等支持原生多模态的大语言模型发布,多模态大语言模型已成为未来发展趋势。
vLLM 作为主流开源推理框架之一,其针对多模态模型结构引发的性能瓶颈,进行了包括 Encoder cache、Encoder DP 及 Encoder Cuda Graph 在内的一系列性能优化,本演讲将深入讲解 vLLM 用于优化多模态模型的关键技术,并展示如何使用最新版本 vLLM 高效部署多模态模型。
莫梓峰,硕士毕业于中山大学,现就职于 Inferact。
作为 vLLM 多模态部分的几位核心开发者之一,深度参与了 vLLM 多模态模型的支持与优化特性维护。
截至 2026 年 6 月,vLLM 已在 GitHub 上获得 82k star,并被广泛应用于 AWS、Meta、Digital Ocean 等大型厂商的生产环境中。
他在本次会议的详细演讲内容如下: 演讲提纲: vLLM 的核心优化技术 PagedAttention Continuous Batching 2.
多模态模型推理在 Continuous Batching 框架下面临的挑战
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜