arXiv 人工智能· Hanyu Wang, Nakul Agarwal, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Makoto Fukushima, Jinghui Chen, Vaishnav Tadiparthi·· 7 小时前AI 评分36
推理强化学习轨迹生成中平衡参考引导与自由生成
Balancing Reference Guidance and Free Generation in Trajectory Rollouts for Reasoning RL
AI 导读
研究提出自适应参考引导(ARG)方法,通过前缀续写在固定生成预算内构建正确轨迹,并应用于 GRPO 的全失败组以优化推理强化学习。在 Qwen3-4B 和 Qwen3-8B 模型上的 5 个数学推理基准实验显示,ARG 在所有评估方法中取得了最高的综合 pass@12 以及具竞争力的平均采样准确率。
来源:arXiv 人工智能 · arxiv.org