本文最初发布于 THENEWSTACK 博客。
图片来自 Unsplash+ , 由 Sara Oliveira 提供 谷歌希望软件开发者在构建 Android 应用时用尽可能好的 AI 模型。
因此,该公司在 3 月份推出了基准测试门户 Android Bench。
该服务旨在提供一个持续更新的排行榜,供开发者和模型创建者参考。
上周,排行榜进行了更新,包括 开放权重模型,并新增了延迟、令牌 和成本等列。
“通过为高质量的 Android 开发设定一个清晰可靠的基准,我们正在帮助模型创建者识别差距并加速改进——这使得开发者能够更高效地工作。
” ——来自谷歌的 Matthew McCullough。
在 3 月份的一篇博文 中,谷歌 Android 开发部门产品副总裁 Matthew McCullough 写道,谷歌对顶级的 AI LLM 进行了基准测试,旨在评估这些工具如何构建 Android 应用。
McCullough 解释说,“我们的目标是为模型创建者提供一个基准,用于评估 LLM 在 Android 开发中的能力。
通过为高质量的 Android 开发设定一个清晰可靠的基准,我们希望可以帮助模型创建者识别差距并加速改进,使他们能够更加高效地工作,让 AI 助手有更广泛的模型可以选择——这最终将提高 Android 生态系统中应用的质量。
” GPT 5.5 是目前 Android 开发的最佳 AI 模型 这项新服务似乎不提供模型排名随时间上升和下降的历史记录,但 9to5Google 报道称,最后一次 Android Bench 将 Gemini 3.1 Pro 与 OpenAI 的 GPT 5.4 并列为该领域的领导者。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜