跳到正文
原文
arXiv 人工智能· Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira Jr., Marlos C. Machado·· 6 小时前AI 评分34

面向目标条件强化学习的多时间尺度学习

Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

AI 导读

研究提出通用隐式时间抽象(GITA),通过将单一价值函数以时间步长 k 为条件并聚合多尺度优势加权监督,解决离线目标条件强化学习(GCRL)在长周期任务中的权衡难题。在 OGBench 评测中,GITA 超越多种基线,全任务平均成功率相比 HIQL 提升 25 个百分点(相对提升 73%),相比固定 k 方法 OTA 提升 7 个百分点。

来源:arXiv 人工智能 · arxiv.org