Hacker News · AI· lieret·· 2 小时前精选AI 评分69
SWE-sweep 评测基准发布:评估 AI 智能体无提示自主发现并修复代码缺陷的能力
Show HN: Benchmark: AI doesn't find bugs unless you tell it what's wrong
AI 导读
研究团队推出针对自主代码修复的评测基准 SWE-sweep,用于测试 AI 智能体在不提供任何 Bug 描述、文件名或位置提示的情况下,能否自主在真实代码仓库中发现并修复缺陷。
推荐理由
该基准改变了以往给定明确 Issue 的评测设定,通过让模型在无提示的代码仓库中自主找错,更真实地衡量了智能体的长流程探索与排错能力。
来源:Hacker News · AI · swesweep.com