计算机科学 > 分布式、并行和集群计算 标题:每瓦智能:测量本地人工智能的智能效率 查看 PDF HTML(实验性) 摘要:大型语言模型(LLM)查询主要由集中式云基础设施中的前沿模型处理。
需求增长对这种范式的压力超过了供应商扩展的速度。
两项进步创造了重新思考它的机会:小型本地 LM(<=20B 主动参数)现在在许多任务上实现了与前沿模型竞争的性能,并且本地加速器(例如 Apple M4 Max)可以以交互延迟托管这些模型。
这就提出了一个问题:本地推理能否有效地重新分配集中式基础设施的需求?
这需要衡量本地 LM 是否能够准确回答现实世界的查询,以及它们是否可以在功率受限的设备(例如笔记本电脑)上高效地回答。
我们提出每瓦智能(IPW)、每单位功率的任务准确性,作为跨模型加速器配置的本地推理能力和效率的统一指标。
我们评估了 20 多个最先进的本地 LM、8 个硬件加速器(本地和云)以及 100 万个现实世界的单轮聊天和推理查询。
对于每个查询,我们都会测量准确性(针对前沿模型的本地 LM 获胜率)、能量、延迟和功率。
我们发现三个关键结果。
首先,本地语言模型成功回答了 88.7% 的查询,但准确度因领域而异。
其次,2023-2025 年的纵向分析显示,在算法和加速器进步的推动下,IPW 提高了 5.3 倍,本地可服务的查询覆盖率从 23.2% 上升到 71.3%。
第三,本地加速器的 IPW 比运行相同模型的云加速器低至少 1.4 倍,这为本地加速器优化提供了巨大的空间。
这些发现表明,本地推理可以有意义地重新分配集中式基础设施对大量查询子集的需求,而 IPW 可以作为跟踪这一转变的关键指标。
提交历史 来自:Jon Saad-Falcon [查看电子邮件] [v1] 世界标准时间 2025 年 11 月 11 日星期二 06:33:30 (5,373 KB) [v2] 世界标准时间 2025 年 11 月 14 日星期五 00:53:12 (5,538 KB) [v3] 世界标准时间 2026 年 2 月 26 日星期四 17:09:14 (5,538 KB) [v4] 世界标准时间 2026 年 5 月 21 日星期四 03:40:21 (5,134 KB)
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜