当人们想象运行大型语言模型时,他们会想到数据中心。
属于其他人的 GPU 机架、计量 API 以及您成功后每个月都会增加的账单。
您将提示发送到黑匣子,并希望价格、型号和隐私政策都保持您注册时的状态。
对于很多球队来说,这是一笔糟糕的交易。
您放弃了对模型何时更改、数据去向以及运行工作负载的硬件的控制。
随着使用量的增加,账单也随之增加,除了“支付更多费用”之外没有其他杠杆可以拉动。
网状法学硕士 是不同的形状。
它将您已有的 GPU 和内存汇集到您想要添加的任意数量的机器上,并将整个系统公开为一个 OpenAI 兼容的 API。
启动一个节点。
稍后添加更多。
让网格决定模型是在您面前的机器上运行、路由到对等点还是拆分到多台机器上。
流行的模型是单体模型。
大多数人通过 UI 或 API 密钥来访问它们,并向大型提供商付费来运行所有内容。
那是方便,也是一种投降。
您无法控制模型何时更新、模型在什么内存中运行,或者底层有什么硬件。
许多依赖这些模型的企业和服务想要相反的结果:更多的控制、更多的可插拔性、更低的成本。
他们的办公室、壁橱里、桌子下都有 GPU。
他们缺少的是一种让这些机器发挥作用的方法。
球场很简单。
无需购买更大的 GPU 即可运行更大的模型。
与您的团队私下共享计算,或与全世界公开共享计算,以支持代理和聊天。
将任何 OpenAI 客户端指向 http://localhost:9337/v1 不再关心工作实际发生的地方。
在幕后,Mesh LLM 在 iroh 端点网格上分配模型计算。
可以通过三种方式处理请求:
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜