跳到正文
原文
GitHub Blog · AI 与安全· Michelle Zhou·· 4 小时前精选AI 评分62

GitHub 推出 AI 代码审查离线评测基准 ReviewBench

ReviewBench: An open benchmark for AI code review

AI 导读

GitHub 推出用于评估 AI 代码审查智能体的离线评测基准 ReviewBench,已开放数据集、评分标准与排行榜。该基准基于 103.9M 真实 PR 分布建模,包含 19 种语言的 219 个代表性 PR,结合人类专家、前沿大模型与静态分析工具构建多源黄金数据集,并由 Claude Sonnet 5 统一裁判。

推荐理由

该基准基于海量真实 PR 分布与多源黄金集构建,为开发者提供了衡量 AI 代码审查质量及预测线上表现的离线评估方案。

来源:GitHub Blog · AI 与安全 · github.blog