跳到正文
原文
arXiv 人工智能· Fei Zhang, Zhaochong An, Duncan Frost, Yikai Wang, Pengfei Liu, Ya Zhang, Michal Drozdzal, Amir Bar·· 5 小时前AI 评分43

基于渐进式视觉规划的世界动作模型 ProWAM

World Action Modeling with Progressive Visual Planning

AI 导读

渐进式世界动作模型 ProWAM 通过联合预测动作与有序稀疏视觉子目标序列,为机器人提供显式视觉引导以实现高效长程控制。该模型仅需单次视频主干前向传播即可缓存子目标特征,在仿真基准 LIBERO-Plus 与随机化 RoboTwin 上分别取得 85.8% 和 75.7% 的 SOTA 成功率。

来源:arXiv 人工智能 · arxiv.org