arXiv 人工智能· Wei Yang, Shawn Li, Yuehan Qin, Yawei Wang, Mingxi Wang, Shixuan Li, Tiankai Yang, Jiate Li, Jesse Thomason, Xuezhe Ma, Yue Zhao·· 5 小时前AI 评分38
SynCo:基于多智能体强化学习的自我演进大语言模型数据合成协同训练框架
SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning
AI 导读
研究团队提出基于多智能体强化学习的自演进大语言模型数据合成协同训练框架 SynCo。该框架联合优化负责构建任务的 Synthesizer 与负责学习的 Reasoner 两个独立智能体,通过互补奖励实现任务生成分布与求解策略的协同演进。在 8 个数学推理基准测试中,SynCo 大幅超越现有合成数据方法与对照基线。
来源:arXiv 人工智能 · arxiv.org