跳到正文
原文
arXiv 自然语言处理· Xia Hu, Brian Potetz, Chun-Ta Lu, Huanfen Yao, Leonidas Guibas, Zhicheng Wang, Howard Zhou, Pengfei Xing, Andrew Gallagher·· 1 天前AI 评分43

MLLM 为何及在何处失效:基于因果任务分解的能力失效诊断

Where MLLMs Fail and Why: Causal Task Decomposition for Capability Failure Diagnosis

AI 导读

研究团队提出因果分解框架与诊断基准 CADET,通过干预先决条件来区分 MLLM 失效源于自身能力缺陷还是上游级联错误。CADET 包含 10 个复合任务拆解出的 46 个单元任务及超 33,000 道人工标注题目。前沿模型评测显示,提供正确先决条件可消除认知任务 54% 的错误,且仅提供单个最关键先决条件即可获得全部先决条件 84% 的增益。

来源:arXiv 自然语言处理 · arxiv.org