跳到正文
原文
arXiv 人工智能· Gabriel Diaz-Ireland, Diego Prieto-Herr\'aez, Mario Garc\'ia Peces, Javier Vel\'azquez, Benjamin Zaitchik, Devika Jain·· 7 小时前AI 评分42

GeoNatureAgent (GNA):面向地理与环境任务的工具调用智能体评测框架及基准

GeoNatureAgent (GNA): A Framework and Benchmark for Pre-Production Evaluation of Tool-Using Agents on Geospatial and Environmental Tasks

AI 导读

研究人员推出地理与环境工具调用智能体评测框架 GeoNatureAgent(GNA),基于 MCP 接口和 103 项任务对 9 个大语言模型展开基准测试。评测显示 Claude Sonnet 4 以 61.7% 准确率位居第一,开源权重的 DeepSeek V3.2 达到 57.9% 且标价成本低 11.3x,其余模型均未超 53%。目前该 MCP 服务器、评测工具及 API 均已公开可用。

来源:arXiv 人工智能 · arxiv.org