arXiv 人工智能· Nico Bohlinger, Jan Peters·· 14 小时前AI 评分33
ChronoSRL:面向自监督强化学习的时间几何方法
ChronoSRL: Temporal Geometry for Self-Supervised Reinforcement Learning
AI 导读
ChronoSRL 为 Critic 嵌入引入显式时间几何结构,使状态-动作与目标嵌入的距离直接匹配到达目标的时间。该方法结合生存强化学习预测时间分布与停留时长,在 7 个标准运动和导航基准上以更小网络实现更快的学习速度与更优性能。在四足机器人仿真到真实测试中,ChronoSRL 是唯一成功实现保持指定速度与目标位置并攀爬最高箱子的自监督强化学习方法。
来源:arXiv 人工智能 · arxiv.org