arXiv 机器学习· Ganghun Lee, Minji Kim, Minsu Lee, Byoung-Tak Zhang·· 4 小时前AI 评分38
奖励膨胀(Reward Inflation):强化学习的良性刺激机制
Reward Inflation: A Healthy Stimulus for Reinforcement Learning
AI 导读
研究提出奖励膨胀(Reward Inflation)机制,在强化学习训练中逐步提升奖励幅度以加快策略适应并保持网络可塑性。该方法隐式提升近期样本在策略更新中的权重,并在策略饱和时持续提供梯度信号来抑制休眠神经元。在 ALE 与 MuJoCo 任务上的实验验证了其有效性,动态调节膨胀水平的自适应变体 Fed 进一步提升了训练表现。
来源:arXiv 机器学习 · arxiv.org