跳到正文
原文
arXiv 人工智能· Yixuan Li, Yiyun Zhou, Yao Long Teng, Fuchao Yang, Yanchen Deng, Zhiyi Lyu, Xuyu Dong, Feng Chen, Bo An·· 2 小时前精选AI 评分73

寻找最佳搭配:模型与框架在智能体任务中的交互效应研究

Finding the Right Fit: Model-Harness Interactions across Agent Tasks

AI 导读

最新研究评测了 66 种智能体配置,发现不同运行框架会导致模型性能排名大幅反转。在 Terminal-Bench 4 上,Claude 在 OpenHands 框架下领先 GPT 7.94 分。

推荐理由

该研究系统揭示了智能体框架与模型搭配对性能的决定性影响,为开发者选型与评测提供了重要对比依据。

来源:arXiv 人工智能 · arxiv.org