AI 工具现已嵌入到 Uber 软件开发的每个阶段。
超过 70% 的代码合并请求由本地或云端智能体生成。
工程师们已经在软件开发生命周期中构建了超过 3600 个智能体技能,每天执行超过 30000 次智能体技能调用。
在 2026 年 AI 工程师大会上,我们分享了我们对软件工厂的愿景以及我们在软件开发生命周期各阶段构建的模块和托管智能体。
随着这一愿景的推进,越来越多的工作会话不再由人工发起,而是由自动化托管智能体完成,包括代码评审、CI 故障自动修复、完成端到端 PR(含视觉验证)、分级处理值班告警、调试新提交的错误,以及各类代码维护任务(需人工审核/升级)。
如图 1 所示,从 2026 年 2 月到 8 月,所有员工(工程师及非工程师)在所有智能体产品中的周活跃用户增长了 7 倍,周智能体请求量增长了 9.4 倍。
与此同时,由于全面优化,我们的 AI 总支出自 4 月份以来已相对稳定。
图 1:2026 年 2 月至 8 月中旬的周活跃用户、智能体请求量及成本,用户数据已跨工具去重。
由于工具采用率、工作负载构成和模型版本升级都在发生持续变化,想要单独衡量我们自身优化带来的收益,就需要固定使用同一个模型,因为每次升级和模型系列变更都会带来行为变化。
我们从 2 月到 7 月做了对照测试:每 1000 次模型请求的成本较峰值下降了近 34%,每次会话的成本较 6 月峰值下降了 52%。
图 2:模型固定情况下的成本优化效果。
单会话成本数据从 5 月底开始。
本文将介绍我们对软件工厂的思考:智能体会话运行的四个层级、用于拆解开销的成本计算公式、各项指标的测算方式,以及我们如何在每一层完成指标优化。
对比的所有定价与供应商指标均基于公开信息,成本效率提升源于我们在标准定价层级内对 Uber 内部业务负载进行更智能的路由调度。
虽然我们测算得到的成本降幅取决于我们的环境,实际效果会因代码库、团队规模、智能体工作流的不同而存在差异,但基于真实业务进行的基准测试、围绕准确率与成本进行优化的这套方法论扔具备普适性。
软件工厂及其成本公式 智能体运行的四个层级
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜