arXiv 自然语言处理· Rui Qi, Yufeng Chen, Yunlong Liang, Chuan Meng, Sijin Lu, Ge Shi, Jinan Xu, Fandong Meng, Kaiyu Huang·· 9 小时前AI 评分34
mRewriter-R1:基于智能体强化学习的自适应多语言推理查询重写
Rewrite What Matters: Adaptive Multilingual Query Rewriting for Reasoning via Agentic Reinforcement Learning
AI 导读
研究人员提出了基于强化学习的智能体多语言查询重写框架 mRewriter-R1,将查询重写建模为多轮顺序决策过程,通过自适应算子选择动态进行多维度优化。实验结果显示,mRewriter-R1 在多种大型推理主干模型上表现均优于强基准。该方法学到的策略能根据查询特征自适应调整重写方式,展现出跨推理任务的泛化能力以及对异构推理模型的即插即用兼容性。
来源:arXiv 自然语言处理 · arxiv.org