AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

研究揭示思维链前缀指令或导致视觉语言模型答案解码失效

最新研究探讨了视觉语言模型(VLM)在多项选择评测中存在的解码陷阱。当评测系统追加思维链(CoT)推理提示,却在模型生成完整推理过程前直接读取答案标签的对数几率时,会导致严重的评估失真。实验显示,Qwen2.5-VL-7B在ScienceQA任务上的准确率从80.76%骤降至45.48%,且超93%的预测倾向于选择首个选项。探针测试证实隐藏层仍保留正确答案,表明失效源于不当的即时读取机制。

阅读原文 ↗推荐理由:揭示了多模态大模型在思维链评测中的隐蔽解码偏差及机理,对大模型基准测试具有重要指导意义。# 视觉语言模型# 思维链# 评测# Qwen-VL# 解码机制
9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

PRISM-VLM:面向紧凑型视觉语言模型的多维度判别评测基准

针对现有评测基准多沿袭前沿大模型设计、导致紧凑型视觉语言模型难以拉开区分度的问题,研究人员推出了 PRISM-VLM 评测基准。该基准围绕轻量级多模态模型的常见失效模式,从任务质量、行为鲁棒性和能力瓶颈等七个关键维度对每个评测样本进行综合打分,并将其融合为单一的 PScore 指标,从而更精确、精细地评估紧凑型多模态模型的真实表现与局限性。

阅读原文 ↗推荐理由:针对轻量级多模态模型评测区分度不足的痛点,提出了涵盖多失效模式的细粒度评测体系。# 视觉语言模型# 评测# 多模态# 紧凑模型