跳到正文
原文
arXiv 自然语言处理· Hexuan Deng, Yue Wang, Wenyu Jiang, Cheng Yang, Haolin Yang, Zhaohua Zhang, Chenchen Zhao, Beiduo Chen, Muxi Chen, Sa Zhu, Geyuan Zhu, Jianhuan Zhuo, Qiuyong Xiao, Tianwen Jiang, Jihong Zhang, Xuebo Liu·· 4 小时前AI 评分48

SWE-Journey:通过长周期多轮交互实现代码助手更真实的评测

SWE-Journey: Towards More Realistic Evaluation of Coding Assistants through Long-Horizon, Multi-Turn Interaction

AI 导读

研究团队推出评测基准 SWE-Journey,通过长周期任务与多轮交互更真实地评估代码助手。该基准采用弱到强合成流程构建任务,并模拟 4 类真实用户画像进行交互测试;模型在软件架构师画像下的功能测试通过率超 75%,而在非程序员画像下不足 25%。结果表明当前代码助手仍无法支持非程序员可靠编程。

来源:arXiv 自然语言处理 · arxiv.org