GitHub 开源 ReviewBench:面向 AI 代码审查的基准测试
ReviewBench: An open benchmark for AI code review
GitHub 做了个专门测 AI 代码审查能力的开源基准 ReviewBench,用真实 PR 和生产对齐的指标打分,做代码审查工具的可以拿来自测。
GitHub 发布 ReviewBench,一个用于评估代码审查智能体的开放基准。该基准基于真实的 GitHub pull requests 构建,采用多来源的 ground truth 标注。评估方法经过校准,指标与生产环境对齐,用于衡量 AI 代码审查的实际效果。
ReviewBench: An open benchmark for AI code review
We’re launching ReviewBench, a benchmark for code review agents built on representative GitHub pull requests, multi-source ground truth, calibrated evaluation, and production-aligned metrics. The post ReviewBench: An open benchmark for AI code review appeared first on The GitHub Blog .