WebLLM 是一种高性能浏览器内 LLM 推理引擎,通过硬件加速将语言模型推理直接引入到 Web 浏览器上。
一切都在浏览器内运行,无需服务器支持,并通过 WebGPU 进行加速。
WebLLM 与 OpenAI API 完全兼容。
也就是说,您可以在本地任何开源模型上使用相同的 OpenAI API,其功能包括流式传输、JSON 模式、函数调用 (WIP) 等。
我们可以带来很多有趣的机会,为每个人构建人工智能助手,并在享受 GPU 加速的同时实现隐私。
您可以使用 WebLLM 作为基础 npm 包,并按照以下示例在其上构建您自己的 Web 应用程序。
该项目是 MLC LLM 的姊妹项目,可实现跨硬件环境的 LLM 通用部署。
浏览器内推理:WebLLM 是一种高性能、浏览器内语言模型推理引擎,利用 WebGPU 进行硬件加速,无需服务器端处理即可直接在 Web 浏览器中实现强大的 LLM 操作。
完全 OpenAI API 兼容性:使用 OpenAI API 将您的应用程序与 WebLLM 无缝集成,并具有流式传输、JSON 模式、logit 级别控制、播种等功能。
结构化 JSON 生成:WebLLM 支持最先进的 JSON 模式结构化生成,在模型库的 WebAssembly 部分中实现,以实现最佳性能。
检查 HuggingFace 上的 WebLLM JSON Playground,尝试使用自定义 JSON 模式生成 JSON 输出。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜