GitHub Blog · AI 与安全· Michelle Zhou·· 4 小时前精选AI 评分62
GitHub 推出 AI 代码审查离线评测基准 ReviewBench
ReviewBench: An open benchmark for AI code review
AI 导读
GitHub 推出用于评估 AI 代码审查智能体的离线评测基准 ReviewBench,已开放数据集、评分标准与排行榜。该基准基于 103.9M 真实 PR 分布建模,包含 19 种语言的 219 个代表性 PR,结合人类专家、前沿大模型与静态分析工具构建多源黄金数据集,并由 Claude Sonnet 5 统一裁判。
推荐理由
该基准基于海量真实 PR 分布与多源黄金集构建,为开发者提供了衡量 AI 代码审查质量及预测线上表现的离线评估方案。
来源:GitHub Blog · AI 与安全 · github.blog