跳到正文
原文
arXiv 自然语言处理· Monika Shah, Sudarshan Balaji, Somdeb Sarkhel, Sanorita Dey, Deepak Venugopal·· 4 小时前AI 评分37

基于合作原则评估视觉语言模型的视觉问答能力

Evaluating VQA in Vision Language Models using Cooperative Principles

AI 导读

基于格莱斯合作原则的评测显示,当视觉问答(VQA)输入包含非必要、歧义或虚假信息等违背原则的修饰时,ChatGPT、Claude、Gemini 和 Llava 的性能均明显下降。实验表明人类与 VLM 在语用推理机制上存在差异,且人类解决 VLM 引发的问题违背时耗时更少,但 VLM 自身在此类场景下的准确率却更低。

来源:arXiv 自然语言处理 · arxiv.org