arXiv 人工智能· Ziqiao Shang, Zian Xu, Ji-Chen Yan, Weiming Wu, Ziyi Jia, Jie Meng, Tao Huang, Shan Huang, Lan-Zhe Guo·· 1 天前AI 评分41
RLHarness:结合强化学习与过程技能协同演化实现长链条多模态推理
RLHarness: Co-evolving Procedural Skills with Reinforcement Learning for Long-horizon Multimodal Reasoning
AI 导读
研究人员提出 RLHarness 框架,将技能(Skills)、协议与示例整合为版本化 Harness,通过与强化学习策略交替演化解决长链条多模态推理难题。该方法结合 SFT、DAPO I、Post-RL 重构与 DAPO II,使 MetroMap/TravelMap 准确率从 16.25%/27.50% 提升至 62.00%/50.00%。
来源:arXiv 人工智能 · arxiv.org