arXiv 人工智能· Zongxia Li, Yucheng Shi, Zhongzhi Li, Junyao Yang, Ruhan Wang, Chengsong Huang, Fuxiao Liu, Haitao Mi, Jordan Boyd-Graber, LeoweiLiang·· 5 小时前AI 评分44
通过递归自重写扩展复杂任务轨迹
Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite
AI 导读
研究提出递归自重写(RSR)框架,基于基座模型 Qwen-3.8-27B 在多种框架下探索复杂任务解法并重构为通用训练轨迹。RSR 将 2,001 条成功源轨迹扩展为 11,094 条重写轨迹用于监督微调,效果优于直接轨迹 SFT。
来源:arXiv 人工智能 · arxiv.org