跳到正文
原文
arXiv 人工智能· Xingang Guo, Jing Gu, Brian Jang, Renxiong Wang, Utkarsh Tyagi, Daniel Quigley, Steven Li, David Yan, Daniel Yue Zhang, Darvin Yi, Forrest Huang, HiJae Kim, Tianyi Zhang, Jared Lichtarge, Jihua Huang, Le Xue, Manan Tomar, Qiuyi Richard Zhang, Ruofei Yu, Seth Neel, Yaning Hu, Marcella Valentine, Xinzhe Jiang, Daniel Evans, Chenguang Wang, Dustin Tran, Tong Zhao, Yinfei Yang, Yunzhong He·· 6 小时前AI 评分47

Humanity's Sixth Sense:评测多模态模型的直觉视觉推理能力

Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models

AI 导读

研究团队推出直觉视觉推理基准 Humanity's Sixth Sense(HSS),旨在评估多模态大语言模型(MLLM)对图像与视频中时间、空间、社交等隐式信息的推断能力。人类受试者准确率达 93.1%,而最强模型 GPT-6-astra 在最大推理力度下仅达到 53.6%。采用动态视觉操作的 AI 智能体方案可缩小但未能消除这一差距。

来源:arXiv 人工智能 · arxiv.org