跳到正文
原文
arXiv 人工智能· Kaixi Feng, Guoheng Sun, Ziyao Wang, Yexiao He, Zheyu Shen, Ang Li·· 4 小时前AI 评分33

DIVA:面向视觉-语言-动作策略的双空间意图感知视觉衰减模块

DIVA: Dual-Space Intent-Aware Visual Attenuation for Vision-Language-Action Policies

AI 导读

研究者提出用于视觉-语言-动作(VLA)策略的 DIVA 模块,结合任务意图与底层视觉证据估计相关性锚点,在进入主干前重加权视觉 token 并在主干内持续衰减低相关状态,无需外部定位监督。

来源:arXiv 人工智能 · arxiv.org