arXiv 人工智能· Haoran Li, Zengle Ge, Xiaomin Yuan, Yui Lo, Haoxin Li, Songlin Zhou, Qianhui Liu, Jiahua Ying, Yuanhang Liu, Mingju Chen, Annan Li, Jianmin Wu, Dawei Yin, Dou Shen·· 7 小时前AI 评分39
AGAR:面向 LLM 程序演化的强化学习基础框架
AGAR: a reinforcement learning substrate for LLM program evolution
AI 导读
研究提出强化学习框架 AGAR,将大语言模型程序演化形式化为马尔可夫决策过程,且无需对后端模型进行梯度训练。该框架将动作定义为模块化前缀,支持信用分配、价值估计、自适应探索与经验记忆等估计器的独立替换与审计。在 19 项任务、2 个后端和 3 个随机种子的测试中,AGAR 在多数任务上超越强基线,提升主要集中在竞赛编程任务。
来源:arXiv 人工智能 · arxiv.org