热点事件持续更新
研究人员提出离线强化学习方法GITA
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月,相关研究提出了面向离线目标条件强化学习(GCRL)的“通用隐式时间抽象”(GITA)方法,旨在解决长周期任务中的多时间尺度权衡难题。该方法通过将单一价值函数以时间步长k为条件,并聚合多尺度优势加权监督展开训练。在OGBench基准评测中,GITA超越了多种基线算法,其全任务平均成功率相比HIQL提升了25个百分点(相对提升73%),相比采用固定步长k的OTA方法提升了7个百分点。
AI 根据报道生成 · 3 小时前更新
最新进展10月2日 12:00
研究团队提出离线强化学习方法GITA,在OGBench评测中全任务平均成功率相比HIQL提升25个百分点。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv 人工智能面向目标条件强化学习的多时间尺度学习
研究提出通用隐式时间抽象(GITA),通过将单一价值函数以时间步长 k 为条件并聚合多尺度优势加权监督,解决离线目标条件强化学习(GCRL)在长周期任务中的权衡难题。在 OGBench 评测中,GITA 超越多种基线,全任务平均成功率相比 HIQL 提升 25 个百分点(相对提升 73%),相比固定 k 方法 OTA 提升 7 个百分点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。