今天我们要介绍 SWE-2,这是我们迄今为止最先进的编码模型。
它推动了功能和成本的帕累托前沿,在 FrontierCode 1.1 Main1 上实现了 50.0%,与 Fable 5.1 相差一个百分点,同时便宜了 64%。
借助 SWE-2,我们在 SWE-1.72 训练基础设施和配方的基础上,首次将强化学习扩展到数万亿参数范围。
关键的补充是强化学习算法,它可以在一次运行中训练所有推理努力级别,从而推进整个性价比前沿。
结果是我们最接近前沿的模型。
在 FrontierCode 1.1 Main 和 DeepSWE 1.1 上,SWE-2 在分数和成本上都击败了 SWE-1.7 和 Grok 4.6,以极低的价格与 GPT-5.6 Sol 和 Fable 5/5.1 相匹配,并且以四分之一的成本与 GPT-6 Astra 相差几分。
SWE-2 是从 Kimi K33 进行后训练的,Kimi K33 是一个 2.8T 参数模型,已经针对代理编码进行了广泛的强化学习。
与 SWE-1.7 一样,我们的 RL 仍然存在巨大的发展空间,在许多基准测试中增加了 5-6 个点,并改变了 K3 的整个性价比前沿。
本文的其余部分介绍了 SWE-2 的不同之处以及我们如何训练它。
我们从 SWE-2 的行为开始,重点关注使其比我们之前的模型更加高效和智能的特征。
然后,我们详细介绍 SWE-2 背后的训练后进展:
- 费用处罚。
我们在单次 RL 运行中对每个努力水平应用线性成本惩罚,每个惩罚都调整为基本模型帕累托前沿的局部斜率。
这种方法源自第一原则,即在保持模型形状的同时推进模型的整个帕累托前沿,并尽可能直接地反映训练中的实际用户成本。
- 奖励基线。
我们推导出自 SWE-1.6 以来使用的长度加权奖励基线,并展示它如何显着稳定训练。
- RL 推出服务。
我们改进调度并训练在线草稿模型以提高解码吞吐量。
通过 NVFP4/FP8 内核和量化感知训练,我们减少了总体内存使用量,并在相似的吞吐量下实现了比 SWE-1.7 更低的训练推理失配,尽管使用的基本模型参数几乎是 3 倍。
- 训练数据。
我们将 RL 环境的数量增加了三倍,添加了指令跟踪覆盖层,并构建了一个由 SWE-2 之前的检查点驱动的飞轮,迭代地强化了我们的验证器。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜