arXiv 自然语言处理· Monika Shah, Sudarshan Balaji, Somdeb Sarkhel, Sanorita Dey, Deepak Venugopal·· 4 小时前AI 评分37
基于合作原则评估视觉语言模型的视觉问答能力
Evaluating VQA in Vision Language Models using Cooperative Principles
AI 导读
基于格莱斯合作原则的评测显示,当视觉问答(VQA)输入包含非必要、歧义或虚假信息等违背原则的修饰时,ChatGPT、Claude、Gemini 和 Llava 的性能均明显下降。实验表明人类与 VLM 在语用推理机制上存在差异,且人类解决 VLM 引发的问题违背时耗时更少,但 VLM 自身在此类场景下的准确率却更低。
来源:arXiv 自然语言处理 · arxiv.org