在周二的 Hot Chips 会议上,OpenAI 分享了 更详细地了解墨西哥辣椒 ,包括新系统的第一批基准测试结果。
在 SemiAnalysis 的 InferenceX 基准测试上进行测试,Jalapeño 比当前可用的最先进的推理处理器注册了更多的每个用户令牌和每千瓦的吞吐量。
OpenAI 硬件主管 Richard Ho 在一次新闻发布会上表示:“最重要的是,结果表明其性能比现有技术有了非常非常显着的进步。
” “Jalapeo 可以在每单位功率上服务更多的 AI 工作,同时也可以更快地返回响应。
为大量客户提供服务非常高效,但延迟也非常低。
” 值得注意的是,这一比较是针对 Nvidia Blackwell 系统的,但当 Jalapeo 完全部署时,竞争可能已经取得了显着进展。
Ho 估计 Jalapeo 将在 2026 年底“小批量”部署,并在 2027 年进行更大规模的部署。
Jalapeo 于去年 10 月首次宣布,由 OpenAI 与 Broadcom 密切合作开发,OpenAI 自己的模型协助开发过程。
该公司计划将 Jalapeo 打造成一个多代平台,允许人工智能产品、模型、芯片和内存协同开发。
由于采用了全栈方法,OpenAI 能够解决推理过程中经常导致推理处理过程中出现摩擦的特定阶段。
特别是,Jalapeño 旨在最大限度地减少处理的预填充和通信阶段的延迟,OpenAI 表示这通常是瓶颈。
该公司在介绍结果的博客文章中表示:“我们设计 Jalapeo 是为了最大限度地减少数据移动和通信延迟。
” “这意味着模型状态,包括生成响应时使用的 KV 缓存,可以显式放置并保留在本地,同时系统为每个推理阶段激活计算、内存和网络的正确组合。
”
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜