arXiv 机器学习· Irving Giovani Bronzatti Petrazzini, Eric Aislan Antonelo·· 6 小时前AI 评分30
基于高斯与 Beta 策略的图像连续控制 DRIL 研究
Disagreement-Regularized Imitation Learning for Image-Based Continuous Control with Gaussian and Beta Policies
AI 导读
分歧正则化模仿学习(DRIL)在少样本图像连续控制任务中显著优于传统行为克隆,在截断动作和有界动作演示下的平均得分分别提升 61% 和 112%。当演示增加至 20 条轨迹时 DRIL 优势收窄,有界动作下 Beta 策略行为克隆比最佳 DRIL 检查点高约 7%。实验基于 CarRacing 环境并采用 5 个高斯策略集成,凸显了策略表示与检查点筛选的重要性。
来源:arXiv 机器学习 · arxiv.org