9月2日
8月28日
18:07
18:07官方账号arXiv cs.AI@Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng
精选73°
MCR-Bench是首个缺陷状态感知的多轮代码审查基准,覆盖5种编程语言,包含2269个真实世界多轮代码审查任务。实验显示主流大模型在缺陷检测和生命周期状态跟踪方面能力有限,随着交互轮次增加性能显著下降。模型在不同缺陷类型和严重程度上表现差异大,语义复杂或低显著性缺陷更易被遗漏。
推荐理由:MCR-Bench揭示了当前LLM在真实代码审查中的不足,特别是跨轮次时间对齐和长程记忆问题。
8月27日
09:23
09:23官方一手arXiv: DeepSeek@Zhuo Chen, Boyang Wang, Xiyue Zhang, Xiaoyun Xu, Ahmad-Reza Sadeghi, Stjepan Picek, Lichao Wu
自动代码审查工具在拉取请求中越来越受欢迎,但评估通常只测量它们是否阻止恶意更改。一个阻止可能是由一个无关的问题触发的,而不是使PR不安全的漏洞;修复报告的问题可能会使目标缺陷可利用。我们将这种差异称为判决-诊断(VD)差距。我们提出了MalPR-Bench,这是一个基于机制的基准,包含89个恶意PR和50个配对的良性控制,涵盖44个存储库和8个语言家族。每个恶意案例都有一个预先提交的规范,指定目标漏洞、接受的机制描述、所需的存储库证据和未获得信用分的离目标发现。审查分别对判决正确性、目标漏洞识别和证据验证进行评分;一个可归因的阻止需要所有三个。我们引入了PRGuard,这是一个可归因的PR安全审查器,它使用确定性、非执行工具和有界检索来构建候选漏洞并验证其前提与存储库证据。在31个常见覆盖率保留的恶意PR中,PRGuard和CodeRabbit的阻止总数相似(22/31与24/31),但PRGuard识别出22个目标漏洞,而CodeRabbit为16个,相差1.38倍。在14个缺失类型的情况下,两者都阻止了9个,而PRGuard识别出9个目标,而CodeRabbit为3个。当所需证据位于所触及的文件中时,CodeRabbit识别出16/24个目标,而当验证需要证据在它们之外时,为0/7。最后,PRGuard在五个项目中发现了十二个以前未公开的、基于概念验证的漏洞。PRGuard/DeepSeek和CodeRabbit都阻止了10/12个发现PR,但分别产生了10/12和4/12个可归因的阻止。因此,仅判决的评估可能会大大高估自动化审查的安全价值。
推荐理由:这篇论文提出了一个名为PRGuard的新工具,用于评估自动代码审查工具在拉取请求中的安全价值,与现有工具相比,它能够更准确地识别目标漏洞,值得一看。
8月24日
05:34
8月23日
21:34
00:04
00:04官方账号Simon Willison’s Weblog博客/媒体
精选
使用编码代理的关键技能是自信地指导他们进行更改,并验证这些更改是否正确应用。有时这需要审查他们所写的每一行代码,但还有其他方法可以达到这个目标。审查每一行代码从未是验证软件更改的最有效方式。
推荐理由:想要提高代码审查效率,可以尝试使用编码代理,它不仅能帮你审查代码,还能以更高效的方式验证更改的正确性。
8月22日
18:03
8月21日
8月7日
8月3日
09:23
09:23官方账号arXiv cs.AI@Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby
ARCTIC 是一个面向 AI 生成代码的代码批判系统,核心能力包括意图预测、漂移检测和代码聚焦。系统基于 1.8 万条真实代码评审归纳出六主题分类法。离线评测中,意图预测 F1 达 0.86,漂移检测与人工标注的 QWK 为 0.907,代码聚焦在质量估计上比基线 AI 评审员好 2.4 倍且 token 消耗减少 5 倍。试点中漂移评分让代码错位额外降低 5.76 个点(p=0.026),意图预测获 90.2% 认可。
推荐理由:这篇论文提出了 ARCTIC,专门解决 AI 写代码太多、人工审不过来的问题。它用意图预测和漂移检测揪出真正需要人看的改动,比传统工具更准更省 token。
7月25日
01:27
01:27官方账号LangChain@LangChainAI
FactoryAI CTO Eno Reyes 在 LangChain 的推文视频中展示了成本对比。针对同一代码审查任务,不同模型框架产生的价格差异极其显著。他强调一个优秀的模型无关框架可以让任何模型在该任务上更经济高效。
推荐理由:FactoryAI 技术负责人用真实数据告诉你,换一个框架做代码审查,成本能差多少倍,很实用。
7月24日
05:46
7月22日
03:29
03:29官方一手@OpenAIDevs@OpenAIDevs
74°
OpenAI 推出新功能,Codex Code Review 现在支持在 AGENTS.md 文件中定义自定义仓库规则。用户可以将审查者反复提到的常见问题写为简洁规则,让 Codex 捕获仓库特定问题,即使相关上下文被隔离。该功能提升了代码审查的准确性和针对性。
事件专题

推荐理由:Codex 代码审查现在能用 AGENTS.md 配置你的仓库专属规则了。把团队常见的检查点写进去,Codex 就能帮你自动抓私有仓库的特有问题。
00:39
7月19日
12:58
12:58官方一手Claude Code: GitHub Releases@ashwin-ant
Claude Code v2.1.215 取消了自动运行 /verify 和 /code-review 技能的机制。用户现在需要通过明确输入 /verify 或 /code-review 命令来主动触发代码验证和审查。这一改动避免了不必要的自动检查,让开发者按需调用。
事件专题

推荐理由:Claude Code 新版改了,自动校验和审查不再自动跑,需要你手动调用了。
7月11日
00:52
00:52官方一手GitHub Blog@Napalys Klicius
精选
GitHub团队发现,为Copilot代码审查引入更强大的工具反而导致性能下降。他们将Copilot的代码审查工作流迁移到共享Unix风格代码探索工具,并围绕pull request证据重构agent流程。这一改进显著降低了代码审查成本,提升了审查效率。
推荐理由:GitHub分享了改进Copilot代码审查的真实案例:不用更花哨的工具,而是用共享Unix工具调整工作流,成本确实降了。
7月10日
03:15
03:15coderabbitai@coderabbitai
CodeRabbit测试了GPT-5.6的两个变体Sol和Terra。Sol在遵循长任务、保持仓库上下文和代码审查基准中展现了更好的召回。Terra作为更便宜的选项适用于小范围工作。报告对比了Fable 5和Opus 4.8的定价与性能。

推荐理由:CodeRabbit实测了GPT-5.6的两个版本,Sol在代码审查中召回更强,Terra则更省钱。对比Fable 5和Opus 4.8,想升级编码工具可以看。
7月8日
01:39
01:39The Rundown AI@therundownai
精选
DoorDash 发布 DashBench 测试,用 105 个历史代码变更评估 AI 代码审查。双模型架构中,Kimi K2.6 负责快速扫描,Claude Fable 5 深入分析。组合方案捕获 65.2% 的真实问题(全 Anthropic 方案为 53.6%),并抓住 8/10 的关键 bug。成本从每变更 $3.91 降至 $3.81。
事件专题

推荐理由:DoorDash 搞了个新基准,用开源 Kimi K2.6 配合 Claude,更便宜还能多抓 bug,做代码审查的可以试试这个搭配。
7月3日
06:48
06:48cat@_catwu
精选
Anthropic发布了内部工具Claude Tag,覆盖工程、产品、数据、销售、营销等团队。该工具内部版本能实现65%的产品pull request成功落地。CEO和CTO分享了从Claude Code到Claude Tag的演进路径及安全设计原则。Claude Fable 5模型现已集成到Claude Tag中。
事件专题

推荐理由:Anthropic搞了个内部神器Claude Tag,能让65%的PR直接过,从CEO到码农都在用,还有Claude Fable 5加持,生产力直接起飞。
6月30日
08:30
08:30coderabbitai@coderabbitai
精选
两年前业界普遍认为AI将加速代码审查,实现同等工作更短时间。实际数据反驳了这一假设:AI审查发现的问题数量增加约1.7倍,逻辑错误增加75%,安全漏洞增加约2倍。代码审查的瓶颈从编写转移到了审查环节。

推荐理由:别以为AI真能帮你省时间——数据说反而多了1.7倍的问题和两倍的漏洞,搞代码的要警惕这个新瓶颈。
6月28日
6月23日
12:34
12:34官方一手arXiv: OpenAI@Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen
一项基于AIDev数据集的长达七个月的纵向分析(400名重复审查者,共11,429条审查记录)发现,审查者对AI生成代码的批准率从30.1%上升至36.8%(Wilcoxon符号秩检验p<10^{-6})。随经验增加,批准率累计差距达14.5个百分点。与此同时,行内评论量下降22%(p=0.0014),但审查延迟增加3.5倍。这种模式提示审查者可能因工作负荷而产生习惯性麻木,而非理性信任调整。
事件专题

推荐理由:这篇论文用真实数据告诉你,人类审查AI代码时会越来越松懈——批准率涨了,评论却少了。做AI代码审核的团队应该看看。