快速介绍 我们都曾在论坛、聊天、reddit、discord、youtube 或其他地方听到过“哦!
模型 XYZ 是 AMAZEBALLZ!
zomgwtfbbq”,然后下载了它(或更可能是它的某种量化形式)并说“呃……这太糟糕了!
” 这篇文章将是一系列相当技术性的实验,以通过推理来证明特定于实施的危险的影响。
我将使用“参考实现”一词来描述发布并提供模型第一方托管并发布原始基准声明的实验室。
他们的硬件将与您的不同。
他们的软件与您的软件有很大不同。
这篇文章中的比较不会运行带有几个测试提示的 2.58 位 gguf-in-ollama。
我有意掩盖整个新兴的研究领域、大量的研究论文和文学评论,以使读者更容易理解。
不要挑剔我的过度简化,否则我会让你读到非常长的、令人不愉快的数学版本。
你的本地实施很糟糕。
但这没关系,因为其他人也是如此。
如今运行法学硕士的每个硬件和软件实例都略有不同。
或者在某些情况下有很大不同。
一般家庭实验室用户可能会混合使用多个不同代的 GPU。
这些芯片具有不同的指令集。
这些指令集将实现并执行数学,以不同于任何其他人的方式计算您的下一个令牌,即使运行相同的精确权重也是如此。
所以这就引出了第一个问题:你的特定设置有多糟糕?
事实证明,有多种不同的方法可以用来衡量这一点。
实际方法很简单。
运行标准基准测试。
其中有各种各样的。
终端长凳、hle、SWEthis、HELLAthat、MMLU——无论什么……任您选择。
只需确保它代表您的实际工作负载/用例即可。
不要将温度调至零并粘贴 3 个测试提示,然后称之为好/坏。
零样本测试并不能很好地模拟大多数代理任务。
您需要长上下文工具调用和特定领域的知识评估,以找出您的设置在与其他人复制相同基准运行相同权重时的薄弱环节。
但纯粹的数学答案是我关注的焦点,因为正如 @wendell 所说: 数学就是数学!
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜