arXiv 机器学习· Sathya Kamesh Bhethanabhotla, Efstratios Gavves, Andr\'e Biedenkapp·· 6 小时前AI 评分31
基于复数值记忆的强化学习
Reinforcement Learning with Complex (valued) Memories
AI 导读
研究人员提出将基于复向量空间的酉循环神经网络(uRNN)作为 recurrent PPO 架构的直接替代方案,以解决强化学习中的部分可观测与长期依赖问题。该方法设计了三种 uRNN 版本,并通过类似量子态测量的方式保留复隐藏状态的相位信息。在 rocksample 和 Craftax 等环境中,该方法取得了基线 2-3 倍的奖励,相关代码已开源。
来源:arXiv 机器学习 · arxiv.org