跳到正文
原文
arXiv 人工智能· Prabin Kumar Rath, Omkar Patil, Nakul Gopalan·· 6 小时前AI 评分35

用于时域不变行为克隆的自监督关键帧发现方法

Self-Supervised Keyframe Discovery for Horizon-Invariant Behavior Cloning

AI 导读

研究人员提出自监督关键帧发现方法 Keyframe Mnemonics,用于解决非马尔可夫环境下行为克隆(BC)策略在长时域推理中的上下文依赖问题。该方法通过将策略条件化在决策关键帧上,在合成记忆任务中实现 100% 成功率并支持超长时域泛化。在 23 项机器人操作基准任务中,其平均绝对成功率较最强基线提升 13.9%,并在真实机器人 20x 更长时域下保持 80% 成功率。

来源:arXiv 人工智能 · arxiv.org