arXiv 人工智能· Haoran Li, Zengle Ge, Xiaomin Yuan, Yui Lo, Songlin Zhou, Jiahua Ying, Haoxin Li, Qianhui Liu, Yuanhang Liu, Jiaqun Liu, Guokai Chen, Mingju Chen, Ruinan Wang, Annan Li, Jianmin Wu, Dawei Yin, Dou Shen·· 6 小时前AI 评分49
RLDiscover:大语言模型驱动的强化学习算法协同演化
RLDISCOVER: LLM-driven co-evolution of reinforcement learning algorithms
AI 导读
RLDiscover 是一个由大语言模型驱动的无模型深度强化学习算法自演化框架,通过渐进式协同演化与渐进式概率评估实现算法自主优化。在 SAC、PPO 和 DQN 上的 4 个基准测试中,各算法族中位数回报提升 32%-84%,峰值回报比达约 363x。在 SAC 运动任务中其评估算力仅需完整评估的约 1/15,生成的算法可有效迁移至未见任务。
来源:arXiv 人工智能 · arxiv.org