arXiv 人工智能· Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei·· 1 天前AI 评分34
RGPO:基于自适应理由脚手架的大模型推理策略优化框架
Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding
AI 导读
研究人员提出 Rationale-Guided Policy Optimization(RGPO)框架,通过自适应利用真实理由作为临时脚手架,解决大语言模型在线强化学习中的奖励稀疏问题。该方法帮助模型生成更高质量解并将其迁移回无引导设置,无需离线数据严格匹配 RL 格式。在纯语言与视觉-语言推理任务中,RGPO 相比 RLVR 基线均实现持续性能提升。
来源:arXiv 人工智能 · arxiv.org