← 返回新闻列表
InfoQ AI 🗓️ 2026-07-11

从 HAMi 到 HAMi-DRA:异构环境的算力资源管理实践|AICon深圳,这意味着什么?

⚡ 一句话看懂:从 HAMi 到 HAMi-DRA:异构环境的算力资源管理实践|AICon深圳,这意味着什么?。来源:InfoQ AI。

Agent 时代,哪些方向正在成为行业关键变量?

50 + 实战案例揭晓答案!

模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。

当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么?

答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。

在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。

本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。

范式智能系统研发专家杨守仁已确认出席 “AI Infra、推理工程与异构计算” 专题,并发表题为《从 HAMi 到 HAMi-DRA:异构环境的算力资源管理实践》的主题分享。

随着国产算力的发展,算力集群的从单一的 NVIDIA 设备逐步走向有更多不同国产厂商设备构成的异构算力集群,异构算力的管理这个问题逐步浮出水面。

HAMi 作为范式参与发起的项目,是范式在异构算力管理上的实践的成果。

HAMi 在易用性和管理能力上取得了一个较好的平衡,但是受限于 Kubernetes 的 Device Plugin 本身的缺陷,调度性能和精细化分配的能力面临瓶颈。

但是随着 Kubernetes v1.34 将 Dynamic Resource Allocation(DRA) 特性正式推进至 GA,集群设备资源管理从以节点为中心的分配模型,逐步演进为以资源对象为核心的声明式管理模式,相比传统 Device Plugin 接口仅能暴露简单容量信息,DRA 通过引入 ResourceClaim 使设备资源能够在 Pod 创建之前完成表达与约束,为 GPU 等复杂硬件资源的精细化调度提供了新的基础能力。

HAMi-DRA 是 HAMi 社区在 DRA 方向上的最新实践,结合范式自身的异构算力管理实践,HAMi-DRA 能在不牺牲核心调度能力的前提下,将现有 GPU 虚拟化调度体系平滑迁移至 DRA 资源模型。

从范式的实践结果来看 HAMi-DRA 在调度性能和精细化管理方面带来了显著的提升。

本次分享将从 Kubernetes 设备资源模型演进的视角出发,向大家介绍范式以及 HAMi 社区在异构设备管理的面临的挑战和实践,同时详细解析 HAMi-DRA 的整体架构设计与关键实现细节,展示如何基于 DRA 构建面向 AI 工作负载的可扩展 GPU 调度方案,并且综合说明在落地 HAMi-DRA 的过程中范式以及社区遇到的挑战。

杨守仁,范式智能(原名第四范式)工程师,系统研发专家。

在范式一直关注在 AI Infra 这个方向上,作为主要的负责人之一,参与范式的 GPU 集群的建设。

目前是 HAMi 社区的 maintainer 之一,主要的贡献集中于 HAMi 调度器的性能优化和 HAMi-DRA 上,并且参与 HAMi 社区的维护工作。

他在本次会议的详细演讲内容如下: 演讲提纲: 背景和动机 异构设备管理的挑战

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接