跳到正文
原文
arXiv 机器学习· Shicheng Liu, Adam Kahirov, Qi Zhang, Zhimin Hu, Song Wang, Junhong Lin, Julian Shun, Yada Zhu·· 4 小时前AI 评分35

VisAudit:多模态 Agent 视觉诊断与修复能力评测基准

VisAudit: Evaluating Multimodal Agents for Visual Diagnosis and Repair

AI 导读

研究人员推出评测基准 VisAudit,用于评估多模态 Agent 对数据可视化的自主诊断、代码修复与结果验证能力。该基准设立已诊断修复、自主修复和开放世界验证 3 个赛道,涵盖 21 种图表类型及 10 种缺陷类别的 1,900 个缺陷实例与 300 个正确图表。评测显示,最强多模态模型在自主修复场景下仅能完全恢复 47.4% 的缺陷图表。

来源:arXiv 机器学习 · arxiv.org