Apple Silicon 和 macOS VM:使用 llama.cpp 将 LLM 推理速度提高 11–16 倍 弗朗西斯科·博纳奇 (Francesco Bonacci) 和约翰尼·弗兰克斯 (Johnny Franks) 于 2026 年 8 月 11 日发布 如果您从一开始就关注 Cua,您可能还记得它是从 显示 HN 推出 Lume,我们的 macOS 虚拟化堆栈。
通过 Apple 运行的 macOS 来宾 虚拟化框架 使用由主机 Apple GPU 支持的虚拟 GPU。
在我们库存的 Tahoe VM 中,该设备报告了保守的 Metal 功能配置文件。
应用程序使用这些答案来选择内核和渲染路径,这使得 llama.cpp 运行速度慢得多的 GPU 代码。
我们构建了一个小型的进程范围的兼容性层,该层可以更改一个来宾进程的选定功能答案,从而允许 llama.cpp 选择更新的 Metal 内核。
这是我们将 Lume 的虚拟化基础与背后的本地计算机使用环境连接起来的更广泛努力的第一个结果 库阿司机
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜