arXiv 人工智能· Kaixi Feng, Guoheng Sun, Ang li·· 4 小时前AI 评分34
PAIR:连接视觉-语言-动作模型的感知与动作
PAIR: Bridging Perception and Action in Vision-Language-Action Models
AI 导读
研究人员提出 PAIR 框架,通过构建共享中间表征连接连续动作视觉-语言-动作(VLA)模型中的感知与动作生成。该框架在 LIBERO-Plus 基准上将 VLA-Adapter 成功率从 59.1% 提升至 64.2%,CALVIN 平均完成序列长度从 4.42 增至 4.53。在 7 项真实世界任务中,PAIR 将 OpenVLA-OFT 的成功率从 51.4% 提升至 65.0%。
来源:arXiv 人工智能 · arxiv.org