← 返回新闻列表
InfoQ AI 🗓️ 2026-07-29

深度解读:Yelp 借助 Training Orchestrator 实现机器学习模型训练的统一管理

⚡ 一句话看懂:深度解读:Yelp 借助 Training Orchestrator 实现机器学习模型训练的统一管理。来源:InfoQ AI。

Yelp 推出 了 Training Orchestrator。

这一全新的内部框架取代了各团队各自独立编写的 Spark 训练脚本。

现在,它采用了一种基于配置、以 DAG 为基础的执行模型。

此举解决了大型机器学习平台中常见的问题。

此前,每个应用机器学习团队都会创建自己的编排方案,这导致了代码重复、配置不一致以及自定义监控机制不稳定等问题。

在此之前,Yelp 的训练任务是以单体脚本的形式运行的,而且与 Spark 集群和作业启动器执行紧密耦合。

这导致了无法在本地运行、可测试性差以及迭代速度缓慢的问题。

即使是很微小的代码更改,也需要提交一个 Spark 作业,然后等待容器和集群启动完成后才能知道是否发生了故障。

验证逻辑分散在各个脚本中,这使得在不同的环境中重现过去的运行过程变得非常困难。

此外,还存在配置不一致和溯源信息缺失等问题。

Training Orchestrator 将“运行什么”与“如何运行”分离开来。

管道使用基于 Pydantic 的配置对象,其中包括协调器配置、 MLflow 运行配置以及各种步骤配置。

所有配置在创建时都会经过验证,因此不会浪费计算资源。

协调器利用声明的步骤依赖关系构建出一个 有向无环图

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接