跳到正文
原文
arXiv 机器学习· Mintae Kim, Koushil Sreenath·· 7 小时前AI 评分30

面向基于模型离线强化学习的分布内想象框架 IDI

In-Distribution Imagination for Model-Based Offline Reinforcement Learning

AI 导读

针对基于模型的离线强化学习(MBORL)因累积误差生成脱离数据分布轨迹的问题,研究人员提出了展开控制框架“分布内想象”(IDI)。该方法在表征空间中估计轨迹支持度,并自适应截断偏离离线轨迹流形的展开,结合轨迹正则化 RL 持续提升了有限数据场景下的性能。实验表明,轨迹支持度预测展开失败的效果显著优于转移级不确定性。

来源:arXiv 机器学习 · arxiv.org