跳到正文
热点事件持续更新

研究评估视觉语言模型在违反合作原则下的VQA能力

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,arXiv发布的一项研究基于格莱斯合作原则对视觉语言模型(VLM)的视觉问答(VQA)能力进行了评测。研究显示,当VQA输入中包含非必要、歧义或虚假信息等违背合作原则的修饰时,ChatGPT、Claude、Gemini和Llava等主流模型的性能均出现明显下降。实验结果表明,人类与VLM在语用推理机制上存在差异;在面对由VLM引发的问题违背场景时,人类解决问题所耗费的时间更少,而VLM自身在此类场景下的答题准确率则更低。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv 自然语言处理
    基于合作原则评估视觉语言模型的视觉问答能力

    基于格莱斯合作原则的评测显示,当视觉问答(VQA)输入包含非必要、歧义或虚假信息等违背原则的修饰时,ChatGPT、Claude、Gemini 和 Llava 的性能均明显下降。实验表明人类与 VLM 在语用推理机制上存在差异,且人类解决 VLM 引发的问题违背时耗时更少,但 VLM 自身在此类场景下的准确率却更低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。