← 返回新闻列表
Hacker News AI 🗓️ 2026-07-16 🌍 英文原文

德国AI联盟发布Soofi S,开放30B模型超越基准

原始标题:Report: German AI consortium releases Soofi S, an open 30B model that tops benchmarks
⚡ 一句话看懂:德国AI联盟发布Soofi S,开放30B模型超越基准。来源:Hacker News AI

德国人工智能联盟发布 Soofi S,一款开放的 30B 模型,在英语和德语方面均领先 要点

  • 德国研究联盟发布了开源语言模型 Soofi S,该模型完全在德国电信的人工智能云基础设施上进行训练。

  • 该模型使用资源高效的混合架构,每个令牌仅激活 316 亿个参数中的 3.2 个,即使输入很长,也能保持处理速度恒定。

  • Soofi S 非常关注德语训练数据,在德语、英语和编程任务的基准测试中优于其他完全开放的模型,例如 Olmo 3 32B 和 Apertus 70B。

更新 –

  • 添加了关于过度训练指控的声明 2026 年 7 月 15 日更新: 推出后,批评者认为,按照经典龙猫缩放法则的标准,Soofi S 严重“训练过度”。

Google DeepMind 于 2022 年发布了这些法律,描述了如何在固定计算预算下平衡模型大小和训练数据。

他们确定的最佳位置是每个参数大约 20 个标记。

Soofi S 超越了这个比例。

约有 27 万亿个代币和 300 亿个参数,其比例为几百比一。

仅考虑每个代币的 32 亿个活跃参数,该比率就会跃升至数千比一。

迈克尔·弗洛姆(Michael Fromm)是该项目的技术领导层,他反驳了这一批评。

他认为这些规则不仅仅适用于专家混合 (MoE) 架构。

“新的研究表明,密集模型的旧缩放法则不再适用于 MoE 架构,”弗洛姆说。

原因在于教育部模型的构建方式。

个别专家受益于查看相同的文档,因此大型高质量数据集中的重复数据问题比密集模型要小。

作为比较,弗洛姆以 Nvidia 为例,该公司在多达 25 万亿个代币上训练了自己的模型。

🔗 原始来源

如果你要核对细节,可以再看原文: Hacker News AI原文链接