具身评测基准 ConflictVLA-Bench 发布:探究 VLA 模型对前提冲突的行为响应
该研究针对视觉-语言-动作(VLA)模型在面对无效任务前提(前提冲突)时的行为反应展开探索。现有评测多聚焦于最终任务结果,难以区分模型是主动终止任务还是盲目尝试导致的执行失败(即“失败执念” Failed Persistence)。为此,研究团队基于 LIBERO 构建了 ConflictVLA-Bench 评测基准,将冲突场景与前提一致的基准轨迹配对,系统评估模型在面对冲突时的执行过程与最终决策表现。
推荐理由聚焦 VLA 模型在不可行任务指令下的行为模式与安全鲁棒性,填补了具身智能在前提冲突评测维度的空白。
原标题:ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts
阅读 arXiv 人工智能 原文 ↗