← 返回新闻列表
InfoQ AI 🗓️ 2026-08-31

最新动态:不抢最贵GPU,专捡“没人要”的算力:前英伟达工程师搞出一套“拾荒者”打法

⚡ 一句话看懂:最新动态:不抢最贵GPU,专捡“没人要”的算力:前英伟达工程师搞出一套“拾荒者”打法。来源:InfoQ AI。

当一群 Agent 不需要休息时,每秒输出 100 个 Token 还是 10 个 Token 没那么重要,真正重要的是:同样 1 美元,到底可以买到多少“智能”。

这是“算力拾荒者” Neil Movva 的想法。

Neil Movva 毕业于 Stanford University,获得电气工程学士和硕士学位。

早在 2016、2017 年,他就在 Nvidia 从事深度学习架构和 GPU 性能优化,研究 Volta GPU、训练工作负载和底层算子,曾将 BatchNorm 性能做到比公开版 cuDNN 最多快约 20%。

此后他进入 Apple 从事深度学习和低延迟推理,又来到 Together AI,成为其最早的内核工程师之一,参与构建大语言模型推理基础设施。

2025 年底,他与 Stanford 同学 Samir Menon 再次走到一起,开始从头重做一套为长程 Agent 设计的推理基础设施。

2026 年 6 月,Sail Research 正式披露累计 8000 万美元种子轮和 A 轮融资,估值达到 4.5 亿美元:种子轮由 Sequoia Capital 领投,A 轮由 Kleiner Perkins 领投,投资者还包括 Redpoint、Theory Ventures、CRV 等,Alphabet 董事长 John Hennessy、Intel CEO Lip-Bu Tan、Together AI 首席科学家 Tri Dao 也以个人投资者身份入场。

所谓“算力拾荒者” 哲学,就是“没有坏芯片,只有坏价格。

”别人抢最贵的 Nvidia GPU,Neil 则研究 AMD、TPU、Trainium 和各种新型加速器;别人要求数据中心达到极高可用率,Neil 认为后台 Agent 甚至可以接受 95%、在足够便宜时可能接受更低的可用率;别人嫌弃零散电力、间歇性的风能和太阳能,而他希望把这些没人愿意碰的芯片、电力和小型数据中心全部聚合起来。

因为当任务本来就要运行几个小时,偶尔多等几分钟,可能远没有成本下降重要。

Neil 在 Invest Like The Best 播客中谈到了 Transformer、 KV Cache 、GPU 内核、Nvidia、AMD、Cerebras,再谈到晶圆厂、小型数据中心、太阳能与风能。

他的核心判断也贯穿始终:极致压低 Token 成本、盘活全球闲置算力、解锁无上限的后台智能消耗。

此外,他也表示,理论上英伟达完全可以不断提价,把有限产能优先卖给资金实力最雄厚的客户。

但英伟达更看重长期利益:如果少数大客户拿走过多 GPU,可能逐渐积累过强的算力和议价权,反而破坏整个生态。

与此同时,关系和信用也成为获得大规模算力的重要门槛。

这种策略也延伸到英伟达对下游业务的克制。

Neil 认为,Nvidia 并不急于亲自做 NeoCloud 或直接向终端用户出售 Token,因为这等于与 CoreWeave 等客户竞争。

相比多赚一层利润,英伟达更希望扶持一批彼此竞争的云厂商和推理服务商:即使其中一家未来选择自研、垂直整合或转向 AMD,仍有其他客户可以迅速补位。

下面对话详情,我们进行了翻译并在不改变原意基础上进行了删减,以飨读者。

Token 只是起点,速度没有想的重要 主持人:既然今天讨论的主题是 Token 成本,你觉得“每 Token 成本”是理解这件事最合适的指标吗?

还是你会用别的方式来定义?

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接