德国人工智能联盟发布 Soofi S,一款开放的 30B 模型,在英语和德语方面均领先 要点
德国研究联盟发布了开源语言模型 Soofi S,该模型完全在德国电信的人工智能云基础设施上进行训练。
该模型使用资源高效的混合架构,每个令牌仅激活 316 亿个参数中的 3.2 个,即使输入很长,也能保持处理速度恒定。
Soofi S 非常关注德语训练数据,在德语、英语和编程任务的基准测试中优于其他完全开放的模型,例如 Olmo 3 32B 和 Apertus 70B。
更新 –
- 添加了关于过度训练指控的声明 2026 年 7 月 15 日更新: 推出后,批评者认为,按照经典龙猫缩放法则的标准,Soofi S 严重“训练过度”。
Google DeepMind 于 2022 年发布了这些法律,描述了如何在固定计算预算下平衡模型大小和训练数据。
他们确定的最佳位置是每个参数大约 20 个标记。
Soofi S 超越了这个比例。
约有 27 万亿个代币和 300 亿个参数,其比例为几百比一。
仅考虑每个代币的 32 亿个活跃参数,该比率就会跃升至数千比一。
迈克尔·弗洛姆(Michael Fromm)是该项目的技术领导层,他反驳了这一批评。
他认为这些规则不仅仅适用于专家混合 (MoE) 架构。
“新的研究表明,密集模型的旧缩放法则不再适用于 MoE 架构,”弗洛姆说。
原因在于教育部模型的构建方式。
个别专家受益于查看相同的文档,因此大型高质量数据集中的重复数据问题比密集模型要小。
作为比较,弗洛姆以 Nvidia 为例,该公司在多达 25 万亿个代币上训练了自己的模型。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜