这是我最近关于法学硕士 RL 后培训的论文的一篇博客文章:介绍马太效应并建议用“永不放弃”来解决它。
它以互动方式呈现,不太正式,更像是我的演讲方式。
如需更深入、更技术性的探索,请查看以下论文: arxiv 和代码 github 。
您的评估实际测量的是什么?
毫无疑问,每一位优秀的强化学习实践者都看到过评估曲线的上升。
这是 Olmo 3.1 RL-Zero Math 的 RL 训练期间的 AIME 2025 评估 (1) (1)
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜