arXiv 人工智能· Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira Jr., Marlos C. Machado·· 6 小时前AI 评分34
面向目标条件强化学习的多时间尺度学习
Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning
AI 导读
研究提出通用隐式时间抽象(GITA),通过将单一价值函数以时间步长 k 为条件并聚合多尺度优势加权监督,解决离线目标条件强化学习(GCRL)在长周期任务中的权衡难题。在 OGBench 评测中,GITA 超越多种基线,全任务平均成功率相比 HIQL 提升 25 个百分点(相对提升 73%),相比固定 k 方法 OTA 提升 7 个百分点。
来源:arXiv 人工智能 · arxiv.org