跳到正文
原文
arXiv 机器学习· Hsiao-Ru Pan, Florent Draye, Bernhard Sch\"olkopf·· 1 天前AI 评分34

ABC:面向可验证奖励强化学习(RLVR)的基于优势控制变量法

ABC: Advantage-Based Control Variates for Reinforcement Learning with Verifiable Rewards

AI 导读

研究人员提出 ABC(Advantage-Based Control Variates),将基于优势的控制变量与直接优势估计(DAE)结合用于可验证奖励强化学习(RLVR)。该方法在离线到在线设置下先预训练 critic 并在在线学习中自适应调整。在数学推理任务中,ABC 仅需大幅减少的在线优化步数即可取得与 GRPO 相当的性能。

来源:arXiv 机器学习 · arxiv.org