SnapTool
返回情报列表
📌 2026-09-16·Hacker News

通过“永不放弃”让 LLM 强化学习学会攻克难题

#强化学习#LLM#研究
  • **这是一篇介绍作者近期 LLM 强化学习后训练论文的博客,论文提出了 RL 训练中的“马太效应”(Matthew Effect)问题,并提出用 Never Give Up(永不放弃)方法解决,论文和代码已发布在 arXiv 和 GitHub。
  • **实验在 Olmo 3.1 RL-Zero Math 上进行 RL 训练,用 AIME 2025 的 30 道题做评估,并将题目按难度分为三档:初始模型 pass@32 得分为 0 的题记为“困难”,其余按通过率均分为“中等”和“简单”。
  • **三档题目的初始 pass@1 平均值分别为 0%、3.8% 和 22.7%。
  • **关键发现:对 AIME 评测取平均掩盖了重要事实——大部分提升来自最简单的题目从“部分解出”变为“基本解出”,而最难的题目几乎没有改善,这一现象从每道题解题率随时间的变化图中清晰可见。
  • **作者还指出这不只是数学 RL 的现象,并在代码 RL 和智能体 RL 上进行了评估。