跳到正文
原文
arXiv 人工智能· Haoran Li, Zengle Ge, Xiaomin Yuan, Yui Lo, Haoxin Li, Songlin Zhou, Qianhui Liu, Jiahua Ying, Yuanhang Liu, Mingju Chen, Annan Li, Jianmin Wu, Dawei Yin, Dou Shen·· 7 小时前AI 评分39

AGAR:面向 LLM 程序演化的强化学习基础框架

AGAR: a reinforcement learning substrate for LLM program evolution

AI 导读

研究提出强化学习框架 AGAR,将大语言模型程序演化形式化为马尔可夫决策过程,且无需对后端模型进行梯度训练。该框架将动作定义为模块化前缀,支持信用分配、价值估计、自适应探索与经验记忆等估计器的独立替换与审计。在 19 项任务、2 个后端和 3 个随机种子的测试中,AGAR 在多数任务上超越强基线,提升主要集中在竞赛编程任务。

来源:arXiv 人工智能 · arxiv.org