← 返回新闻列表
Hacker News AI 🗓️ 2026-09-15 🌍 英文原文

法学硕士学习如何解决强化学习中的难题,永不放弃

原始标题:Latest: Learning to solve hard problems in RL for LLMs by never giving up
⚡ 一句话看懂:评论网址: 积分:111 # 评论:6

这是我最近关于法学硕士 RL 后培训的论文的一篇博客文章:介绍马太效应并建议用“永不放弃”来解决它。

它以互动方式呈现,不太正式,更像是我的演讲方式。

如需更深入、更技术性的探索,请查看以下论文: arxiv 和代码 github 。

您的评估实际测量的是什么?

毫无疑问,每一位优秀的强化学习实践者都看到过评估曲线的上升。

这是 Olmo 3.1 RL-Zero Math 的 RL 训练期间的 AIME 2025 评估 (1) (1)

🔗 原始来源

如果你要核对细节,可以再看原文: Hacker News AI原文链接