面向可解释推理的自动驾驶多数据集语义谓词框架
该研究针对视觉语言模型在驾驶场景理解中语义关系难以与真实交通状况核验的问题,提出了一个确定性多数据集谓词框架。该框架从几何、运动学、时间、地图及交通控制等可测量物理证据中推导驾驶语义,并在nuPlan和nuScenes等数据集间保持谓词定义统一,构建了统一的谓词知识体系,以增强自动驾驶场景推理的可解释性与可验证性。
推荐理由提出将多模态大模型在自动驾驶场景下的推理与物理世界可测量证据对齐的谓词框架,对自动驾驶可解释性有一定参考价值。
原标题:Grounding Vision-Language Models in Driving Semantics: A Multi-Dataset Predicate Framework for Explainable Reasoning
阅读 arXiv 机器学习 原文 ↗