跳到正文
原文
arXiv 机器学习· Xinjie Liu, Ruihan Zhao, Anirban Chaudhuri, Cyrus Neary, Ufuk Topcu, David Fridovich-Keil·· 4 小时前AI 评分34

多保真度策略梯度稳定数据稀缺下的强化学习

Multi-Fidelity Policy Gradients Stabilize Data-Scarce Reinforcement Learning

AI 导读

MFPG-PPO 框架通过结合廉价低保真数据构建控制变量,降低了数据稀缺在线强化学习中的策略梯度估计方差。在仿真机器人任务中,该方法在极小高保真预算下达到了纯高保真 PPO 需 16x 更多数据才能实现的性能。在物理 Franka 机械臂实验中,每次更新仅需 4 个真实机器人 episode 且无需人类演示即可实现稳定学习。

来源:arXiv 机器学习 · arxiv.org