Yelp 推出 了 Training Orchestrator。
这一全新的内部框架取代了各团队各自独立编写的 Spark 训练脚本。
现在,它采用了一种基于配置、以 DAG 为基础的执行模型。
此举解决了大型机器学习平台中常见的问题。
此前,每个应用机器学习团队都会创建自己的编排方案,这导致了代码重复、配置不一致以及自定义监控机制不稳定等问题。
在此之前,Yelp 的训练任务是以单体脚本的形式运行的,而且与 Spark 集群和作业启动器执行紧密耦合。
这导致了无法在本地运行、可测试性差以及迭代速度缓慢的问题。
即使是很微小的代码更改,也需要提交一个 Spark 作业,然后等待容器和集群启动完成后才能知道是否发生了故障。
验证逻辑分散在各个脚本中,这使得在不同的环境中重现过去的运行过程变得非常困难。
此外,还存在配置不一致和溯源信息缺失等问题。
Training Orchestrator 将“运行什么”与“如何运行”分离开来。
管道使用基于 Pydantic 的配置对象,其中包括协调器配置、 MLflow 运行配置以及各种步骤配置。
所有配置在创建时都会经过验证,因此不会浪费计算资源。
协调器利用声明的步骤依赖关系构建出一个 有向无环图
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜