arXiv 人工智能· Michael Hardy, Ruhana Azam, Anka Reuel, Mykel Kochenderfer, Sanmi Koyejo·· 3 小时前AI 评分53
智能体评测可靠性研究:单纯增加任务无法解决 Agent 排行榜排名失真
Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard
AI 导读
arXiv 新论文提出针对稀疏不平衡 Agent 排行榜的贝叶斯方差分解框架,指出评测排名高度依赖评估目标,固定脚手架系统的排名可靠性达 0.935-0.994,但底层模型排名的可靠性仅为 0.148-0.841。研究表明在脚手架覆盖受限时单纯增加同类任务最多只能提升 0.097 的可靠性,而聚合多样化基准可在相同预算下将可靠性从 0.44 提升至 0.75 并降低最高 83% 的评测成本。
来源:arXiv 人工智能 · arxiv.org