跳到正文
原文
arXiv 人工智能· Yaolun Zhang, Tianyi Xu, Yujie Zhao, Jishen Zhao, Qingyun Wu, Huazheng Wang·· 7 小时前AI 评分45

EvalResearchBench:AI 智能体能否自主设计评测?

EvalResearchBench: Can AI Agents Design Their Own Evaluations?

AI 导读

研究团队推出用于测试 AI 智能体自主设计评测基准能力的 EvalResearchBench(ERB)。在包含 9 个研究者智能体、13 个候选模型与 14 个目标基准的测试中,最佳评估器在候选模型成对排序上达到约 75% 的一致性,低于目标基准间 91% 的上限。实验中执行成本最低的评估器取得最高成对一致性,但智能体生成的评估器仍存在截断答案和耗尽预算等缺陷。

来源:arXiv 人工智能 · arxiv.org