arXiv 人工智能· Xing Han L\`u, Dheeraj Vattikonda, Sina Hajimiri, Fatemeh Pesaran Zadeh, Parishad BehnamGhader, Ghazwa Darwiche, Amirhossein Kazemnejad, Christopher Pal, Alexandre Drouin, Siva Reddy·· 8 小时前AI 评分50
AgentHorizon:评估长流程计算机使用任务中的智能体裁判
AgentHorizon: Evaluating Agentic Judges for Long-Horizon Computer-Use Tasks
AI 导读
研究团队推出计算机使用评测基准 AgentHorizon,基于 3 个操作系统的 166 小时人类轨迹构建了 1,373 个任务对,并划分为 AH、AH-S 和 AH-D 三个子集。在对 11 个裁判模型的评测中,表现最佳的智能体裁判 GPT-5.5 在 AH 子集上取得了 80.9% 的平衡准确率。研究还发现工具调用可改善部分模型,但会导致开源权重模型性能下降。
来源:arXiv 人工智能 · arxiv.org