arXiv 人工智能· Liyu Hou, Yuan Wu, Yi Chang·· 1 天前AI 评分39
ConflictVLA-Bench:评测 VLA 模型对前提冲突的行为响应
ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts
AI 导读
研究人员提出评测基准 ConflictVLA-Bench,基于 LIBERO 构建 2,826 个冲突任务,用于评估 VLA 模型应对无效任务前提的行为响应与执行过程。在评测的 8 个 VLA 模型中,无效前提导致目标完成率至少下降 17.3 个百分点,OpenVLA 下降达 56.2 个百分点。结果显示模型普遍存在继续盲目逼近目标的“失败持续性”,显式前提检查也未能稳定产生协调的行为改变。
来源:arXiv 人工智能 · arxiv.org