← 返回新闻列表
Hacker News AI 🗓️ 2026-09-10 🌍 英文原文

Cognition 推出新的 SWE-2 模型,与 Fable 5.1 和 GPT-Astra 相媲美

原始标题:Update: Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra
⚡ 一句话看懂:文章网址: 评论网址: 积分:222 # 评论:103

今天我们要介绍 SWE-2,这是我们迄今为止最先进的编码模型。

它推动了功能和成本的帕累托前沿,在 FrontierCode 1.1 Main1 上实现了 50.0%,与 Fable 5.1 相差一个百分点,同时便宜了 64%。

借助 SWE-2,我们在 SWE-1.72 训练基础设施和配方的基础上,首次将强化学习扩展到数万亿参数范围。

关键的补充是强化学习算法,它可以在一次运行中训练所有推理努力级别,从而推进整个性价比前沿。

结果是我们最接近前沿的模型。

在 FrontierCode 1.1 Main 和 DeepSWE 1.1 上,SWE-2 在分数和成本上都击败了 SWE-1.7 和 Grok 4.6,以极低的价格与 GPT-5.6 Sol 和 Fable 5/5.1 相匹配,并且以四分之一的成本与 GPT-6 Astra 相差几分。

SWE-2 是从 Kimi K33 进行后训练的,Kimi K33 是一个 2.8T 参数模型,已经针对代理编码进行了广泛的强化学习。

与 SWE-1.7 一样,我们的 RL 仍然存在巨大的发展空间,在许多基准测试中增加了 5-6 个点,并改变了 K3 的整个性价比前沿。

本文的其余部分介绍了 SWE-2 的不同之处以及我们如何训练它。

我们从 SWE-2 的行为开始,重点关注使其比我们之前的模型更加高效和智能的特征。

然后,我们详细介绍 SWE-2 背后的训练后进展:

  • 费用处罚。

我们在单次 RL 运行中对每个努力水平应用线性成本惩罚,每个惩罚都调整为基本模型帕累托前沿的局部斜率。

这种方法源自第一原则,即在保持模型形状的同时推进模型的整个帕累托前沿,并尽可能直接地反映训练中的实际用户成本。

  • 奖励基线。

我们推导出自 SWE-1.6 以来使用的长度加权奖励基线,并展示它如何显着稳定训练。

  • RL 推出服务。

我们改进调度并训练在线草稿模型以提高解码吞吐量。

通过 NVFP4/FP8 内核和量化感知训练,我们减少了总体内存使用量,并在相似的吞吐量下实现了比 SWE-1.7 更低的训练推理失配,尽管使用的基本模型参数几乎是 3 倍。

  • 训练数据。

我们将 RL 环境的数量增加了三倍,添加了指令跟踪覆盖层,并构建了一个由 SWE-2 之前的检查点驱动的飞轮,迭代地强化了我们的验证器。

🔗 原始来源

如果你要核对细节,可以再看原文: Hacker News AI原文链接