跳到正文
原文
arXiv 人工智能· Yizhi Song, Hang Ni, Weijia Zhang, Hao Liu·· 7 小时前AI 评分35

DUDA-Bench:面向多模态数据驱动城市诊断的 LLM Agent 评测基准

DUDA-Bench: Benchmarking LLM Agents on Multimodal Data-Driven Urban Diagnosis

AI 导读

研究团队推出分层交互式评测基准 DUDA-Bench,用于评估大语言模型 Agent 在多模态数据驱动城市诊断中的端到端执行能力。该基准包含涵盖 4 个分析阶段的 86 个原子任务和 22 个工作流任务,基于 12 座城市的 5 类城市问题多模态数据构建。对 7 个骨干模型和 5 个 Agent 系统的评测显示,模型在孤立分析能力与端到端诊断表现之间存在显著差距。

来源:arXiv 人工智能 · arxiv.org