跳到正文
原文
arXiv 人工智能· Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei·· 1 天前AI 评分34

RGPO:基于自适应理由脚手架的大模型推理策略优化框架

Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding

AI 导读

研究人员提出 Rationale-Guided Policy Optimization(RGPO)框架,通过自适应利用真实理由作为临时脚手架,解决大语言模型在线强化学习中的奖励稀疏问题。该方法帮助模型生成更高质量解并将其迁移回无引导设置,无需离线数据严格匹配 RL 格式。在纯语言与视觉-语言推理任务中,RGPO 相比 RLVR 基线均实现持续性能提升。

来源:arXiv 人工智能 · arxiv.org