23:13Martin Fowler@martinfowlerMartin Fowler分享了Rachel的观点,质疑我们是否应该审查所有代码。文章指出,AI并没有破坏代码审查,而是我们可能一直用代码审查解决了错误的问题。这一观点引发了软件开发社区的广泛讨论,获得了4185次浏览和25个点赞。行业Martin Fowler代码审查AI推荐理由:Martin Fowler转发了Rachel对代码审查本质的思考,AI时代我们是否需要改变代码审查方式?原文稍后读已读值得跟进有用关注 Martin Fowler
11:56宝玉@dotey精选73°Warp终端工具发布新方案,通过代码审查Skill和改进Skill解决Agent记忆问题。该方案收集人类工程师对代码审查的评论,自动更新审查技能。实践表明,低摩擦反馈机制比手动调整系统提示词更有效。Skill文件保持精简,引用资源而非塞入全部内容。技巧WarpClaude智能体推荐理由:Warp分享了如何让Agent根据人类反馈自动进化技能,比手动调整更高效,还总结了6个实用技巧。原文稍后读已读值得跟进有用关注 Warp
07:18AI Engineer@aiDotEngineer亚马逊团队原计划用30人和18个月完成推理数据平面,实际6名工程师(含2名杰出工程师)仅用76天完成。优步代码审查时间从2024年的3小时增至2026年的9小时,uReview每周生成25,000条评论。优步70%以上的PR来自智能体,Figma工程师因AI分析粗糙而回归人工撰写PR描述。行业AmazonUberFigma推荐理由:亚马逊团队76天完成原计划18个月的工作,优步AI代码审查工具每周处理2.5万评论,看看科技公司如何应对AI带来的效率变化。原文稍后读已读值得跟进有用关注 Amazon
18:07官方账号arXiv cs.AI@Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng精选73°MCR-Bench是首个缺陷状态感知的多轮代码审查基准,覆盖5种编程语言,包含2269个真实世界多轮代码审查任务。实验显示主流大模型在缺陷检测和生命周期状态跟踪方面能力有限,随着交互轮次增加性能显著下降。模型在不同缺陷类型和严重程度上表现差异大,语义复杂或低显著性缺陷更易被遗漏。论文MCR-Bench代码审查LLM推荐理由:MCR-Bench揭示了当前LLM在真实代码审查中的不足,特别是跨轮次时间对齐和长程记忆问题。原文稍后读已读值得跟进有用关注 MCR-Bench
09:23官方一手arXiv: DeepSeek@Zhuo Chen, Boyang Wang, Xiyue Zhang, Xiaoyun Xu, Ahmad-Reza Sadeghi, Stjepan Picek, Lichao Wu自动代码审查工具在拉取请求中越来越受欢迎,但评估通常只测量它们是否阻止恶意更改。一个阻止可能是由一个无关的问题触发的,而不是使PR不安全的漏洞;修复报告的问题可能会使目标缺陷可利用。我们将这种差异称为判决-诊断(VD)差距。我们提出了MalPR-Bench,这是一个基于机制的基准,包含89个恶意PR和50个配对的良性控制,涵盖44个存储库和8个语言家族。每个恶意案例都有一个预先提交的规范,指定目标漏洞、接受的机制描述、所需的存储库证据和未获得信用分的离目标发现。审查分别对判决正确性、目标漏洞识别和证据验证进行评分;一个可归因的阻止需要所有三个。我们引入了PRGuard,这是一个可归因的PR安全审查器,它使用确定性、非执行工具和有界检索来构建候选漏洞并验证其前提与存储库证据。在31个常见覆盖率保留的恶意PR中,PRGuard和CodeRabbit的阻止总数相似(22/31与24/31),但PRGuard识别出22个目标漏洞,而CodeRabbit为16个,相差1.38倍。在14个缺失类型的情况下,两者都阻止了9个,而PRGuard识别出9个目标,而CodeRabbit为3个。当所需证据位于所触及的文件中时,CodeRabbit识别出16/24个目标,而当验证需要证据在它们之外时,为0/7。最后,PRGuard在五个项目中发现了十二个以前未公开的、基于概念验证的漏洞。PRGuard/DeepSeek和CodeRabbit都阻止了10/12个发现PR,但分别产生了10/12和4/12个可归因的阻止。因此,仅判决的评估可能会大大高估自动化审查的安全价值。论文安全审查拉取请求代码审查推荐理由:这篇论文提出了一个名为PRGuard的新工具,用于评估自动代码审查工具在拉取请求中的安全价值,与现有工具相比,它能够更准确地识别目标漏洞,值得一看。原文稍后读已读值得跟进有用关注 安全审查
05:34elvis@omarsar0精选研究多智能体系统在代码审查中的应用,提出Adversarial Review方法,使用三个智能体进行审查,在LiveCodeBench上优于五智能体基线,在SWE-PRBench上实现最高F1值。论文智能体代码审查多模态推荐理由:这篇论文探讨了如何使用多智能体系统进行代码审查,提出了一种新的方法,值得一读。原文稍后读已读值得跟进有用关注 智能体
21:34Suhail@SuhailGitHub 成为主要沟通平台,帮助调试问题。搜索 PRs 和 issues,可找到参考解决方案。技巧GitHub调试问题沟通平台推荐理由:GitHub 成为了调试问题的得力助手,能帮你快速找到解决方案。原文稍后读已读值得跟进有用关注 GitHub
00:04官方账号Simon Willison’s Weblog(博客/媒体)精选使用编码代理的关键技能是自信地指导他们进行更改,并验证这些更改是否正确应用。有时这需要审查他们所写的每一行代码,但还有其他方法可以达到这个目标。审查每一行代码从未是验证软件更改的最有效方式。技巧代码审查编码代理生成式AI推荐理由:想要提高代码审查效率,可以尝试使用编码代理,它不仅能帮你审查代码,还能以更高效的方式验证更改的正确性。原文稍后读已读值得跟进有用关注 代码审查
18:03Viking@vikingmuteCursor IDE 已被 Agent View 取代,Zed 使用减少,代码审查转向多 Agent 互相 review,验证转向 E2E 黑盒模式。技巧Cursor代码审查Agent View3 个信源在谈事件专题推荐理由:Cursor IDE 被新工具 Agent View 取代,体验代码审查自动化,看看如何转型。原文稍后读已读值得跟进有用关注 Cursor
20:58shao__meng@shao__meng精选Cursor Team Kit 新增 "Thermo-Nuclear Code Quality Review" Skill,一套严格的代码可维护性审查方法论,包含八条不可妥协的审查标准,旨在提升代码质量,对抗 AI 代码生成的典型问题。该 Skill 将 "代码质量"从模糊审美转化为可操作的检查清单,是审查 AI 生成 PR 的利器。AI产品Cursor代码质量审查标准9 个信源在谈事件专题推荐理由:Cursor Team Kit 新增 "Thermo-Nuclear Code Quality Review" Skill,帮你提升代码质量,对抗 AI 代码生成问题,是审查 PR 的利器。原文稍后读已读值得跟进有用关注 Cursor
02:50GitHub@githubGitHub Copilot代码审查的Balanced深度选项现已全面可用。该选项提供更深入的分析和更全面的拉取请求审查,适合复杂改动。用户还可选择Lite模式处理简单变更,并在组织或仓库级别设置默认深度。在请求审查时也能按需选择具体深度。AI产品GitHubCopilot代码审查推荐理由:GitHub Copilot的代码审查现在能选深度了,要更全面就选Balanced,简单改动选Lite,还能设默认。原文稍后读已读值得跟进有用关注 GitHub
02:43GitHub@githubGitHub官方博客发布教程,讲解如何将一个巨大的AI生成pull request拆分成干净、可审查的提交栈。教程针对AI编码工作流中常见的大PR问题,演示如何在反馈落地时保持各层同步。读者可以学到把单一巨型PR转化为多个逻辑提交的具体步骤。技巧GitHub代码审查PR推荐理由:GitHub 官方出的教程,教你怎么把 AI 写的一大坨 PR 拆成一串能逐个看的提交,反馈来了还能同步更新,很实用。原文稍后读已读值得跟进有用关注 GitHub
02:42GitHub@github精选GitHub官方推文(9837次查看)指出,AI编码智能体生成的PR往往过于庞大。该推文建议把改动拆成多个有序PR,获得5次转发和59次点赞。采用PR栈工作流后,每个PR只包含一个逻辑改动,审查效率更高。技巧GitHubAI编程智能体PR工作流推荐理由:GitHub官方支招:AI写代码别把改动堆成巨型PR,拆成有序小PR更好审,试试看。原文稍后读已读值得跟进有用关注 GitHub
23:41elvis@omarsar0精选Qodo发布了AI Code Review Academy,这是一套免费的代码审查学习章节,无需注册即可访问。其中基准测试与工具对比章节建议,评估审查工具时应使用真实生产环境的PR数据,并让所有工具在默认设置下运行。该章节引用2025年一项研究,同一模型在孤立基准测试中得分84-89%,但在真实代码库中仅得25-34%。Qodo建议用自己代码库的10-20个PR来测试候选工具。技巧Qodo代码审查AI Code Review Academy推荐理由:Qodo出了个免费学院,专门教你怎么评估AI代码审查工具,不用注册就能看。里面讲清楚了基准测试怎么才算靠谱,还给了实测数据,挺实在的。原文稍后读已读值得跟进有用关注 Qodo
07:13官方账号Greg Brockman@gdb71°OpenAI 推出 Codex Security Review 研究预览版。该功能会自动审查 GitHub 拉取请求中的安全漏洞,并利用仓库上下文直接在 PR 中给出可操作的修改建议。开发者可通过 learn.chatgpt.com/docs/security 文档启用自动审查。OpenAI 表示这是提升代码与公司整体安全性的计划之一。AI产品CodexGitHubOpenAI10 个信源在谈事件专题推荐理由:OpenAI 给 Codex 加了自动安全审查能力,直接在每个 GitHub PR 上挑毛病并写评论,团队不用手动盯代码了。原文稍后读已读值得跟进有用关注 Codex
05:46官方一手GitHub Blog@Julia MuiruriGitHub官方博客介绍如何让编程智能体将一次生成的大量代码拆分成有序的堆叠式Pull Request。文章以GitHub Stacked Pull Requests功能为基础,说明通过拆分可避免单个PR过大导致无法审查。作者给出了具体的操作流程和配置方法,帮助开发者在AI辅助编码时保持代码审查质量。技巧GitHubPull Request编程助手推荐理由:GitHub官方出的教程,教你让AI写代码别一次性塞个大PR,拆成小堆栈,审查起来不头大。原文稍后读已读值得跟进有用关注 GitHub
18:40Geek@geekbb一个纯markdown的skill在GitHub上公开,把agent写的代码当黑盒。它要求agent开工前先交测试计划,写完后交带数字的证据报告。工作流借鉴自Uncle Bob,测试闯不过关卡就不算完成。程序员只审测试计划和证据报告,不必逐行读代码。技巧智能体测试报告代码审查推荐理由:别逐行盯agent代码了,geekbb这个skill让agent先交测试计划再交证据报告,你只看报告,来自Uncle Bob的思路。原文稍后读已读值得跟进有用关注 智能体
09:23官方账号arXiv cs.AI@Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. RigbyARCTIC 是一个面向 AI 生成代码的代码批判系统,核心能力包括意图预测、漂移检测和代码聚焦。系统基于 1.8 万条真实代码评审归纳出六主题分类法。离线评测中,意图预测 F1 达 0.86,漂移检测与人工标注的 QWK 为 0.907,代码聚焦在质量估计上比基线 AI 评审员好 2.4 倍且 token 消耗减少 5 倍。试点中漂移评分让代码错位额外降低 5.76 个点(p=0.026),意图预测获 90.2% 认可。论文ARCTIC代码审查漂移检测推荐理由:这篇论文提出了 ARCTIC,专门解决 AI 写代码太多、人工审不过来的问题。它用意图预测和漂移检测揪出真正需要人看的改动,比传统工具更准更省 token。原文稍后读已读值得跟进有用关注 ARCTIC
01:26官方账号LangChain@LangChainAILangChain 推出 ReviewBench,一个专注于代码审查场景的新基准。该基准从真实 PR 审查意见出发,将审查中发现的问题整理成具体任务,并转化为基于 Harbor 框架的可复现实验。其目标是模拟开发者在实际代码审查中遇到的典型问题,帮助评估模型在审查场景中的表现。AI模型ReviewBenchLangChainHarbor推荐理由:LangChain 做了个叫 ReviewBench 的基准,专门测代码审查能力,数据来自真实 PR 评论,还能用 Harbor 复现。原文稍后读已读值得跟进有用关注 ReviewBench
16:09Viking@vikingmute83°GitHub 官方在 changelog 中宣布支持 Stacked Pull Requests。该功能允许把一个大改动拆成一系列有序且互相依赖的小 PR,每个小 PR 保持独立。这种流程适合 AI 每次改动产生几万行代码的场景,方便逐批审查和合并。GitButler 此前已经支持类似的堆叠 PR 工作流。AI产品GitHubStacked Pull RequestsGitButler推荐理由:GitHub 官方要支持 Stacked PR 了,大改动拆小 PR 逐个审,AI 写代码几万行时特别有用。原文稍后读已读值得跟进有用关注 GitHub
13:38宝玉@dotey72°在Jerry Liu与多位创始人共进晚餐的讨论中,几乎所有人都认为1-2年内将无人审查代码。他们提到可通过多智能体交接和cron jobs构建长期运行的自主智能体循环,而目前多数人并未在Codex或Claude Code中使用主动审查循环。人类仍需提供对齐、护栏和判断力,但AI所需上下文仅需代码库与部分文档。行业代码审查AI编程自主智能体1 个信源在谈事件专题推荐理由:Jerry Liu分享了一场创始人晚餐的真实讨论,大家觉得一两年后没人会再审查代码了,还聊了用多智能体和cron jobs做长期循环,挺有意思。原文稍后读已读值得跟进有用关注 代码审查
01:08DeepLearning.AI@DeepLearningAIDeepLearning.AI与QodoAI合作推出免费短期课程《AI Code Review》,由nnennahacks讲授。课程强调三个核心实践:在提交PR前进行审查、为审查者提供完整的代码库上下文、按风险对发现进行分类。学员将构建自己的审查代理,包括上下文引擎和专业化审查团队。课程现已开放免费注册。技巧DeepLearning.AIQodoAI代码审查推荐理由:DeepLearning.AI教你用AI高效审代码,三步策略减少漏审风险,还能亲手搭审查机器人,免费学不亏。原文稍后读已读值得跟进有用关注 DeepLearning.AI
01:27官方账号LangChain@LangChainAIFactoryAI CTO Eno Reyes 在 LangChain 的推文视频中展示了成本对比。针对同一代码审查任务,不同模型框架产生的价格差异极其显著。他强调一个优秀的模型无关框架可以让任何模型在该任务上更经济高效。行业FactoryAIEno ReyesLangChain推荐理由:FactoryAI 技术负责人用真实数据告诉你,换一个框架做代码审查,成本能差多少倍,很实用。原文稍后读已读值得跟进有用关注 FactoryAI
05:46官方一手@OpenAIDevs@OpenAIDevs精选该 primary folder 可处理 Git 操作、代码审查和拉取请求。它还包含 AGENTS.md 配置文件,用于定义 Agent 行为。并集成了技能发现功能,让 Agent 自动获取能力。AI产品OpenAI智能体Git10 个信源在谈事件专题推荐理由:OpenAI 搞了个专用文件夹,一次搞定 Git 操作、代码 Review 和技能发现,Agent 开发省事多了。原文稍后读已读值得跟进有用关注 OpenAI
11:16shao__meng@shao__meng81°OpenAI 为 Codex Code Review 推出 AGENTS.md 规则文件,允许团队将隐性审查知识写入仓库。在测试集上,带规则的审查找到了 98% 的目标问题,远超无规则时的 58.3%,提升来自为模型补上“该看什么”的上下文。规则需聚焦于如兼容性、数据边界等难以用 linter 捕捉的判断类问题,并给出安全替代方案。OpenAI 建议用三元测试(一个应触发规则、一个安全反例、一个无关改动)来快速验证规则质量。技巧OpenAICodex Code ReviewAGENTS.md10 个信源在谈事件专题推荐理由:OpenAI 给 Codex Code Review 加了 AGENTS.md 规则,能抓住 diff 看不出的破坏性改动,评测召回率从 58% 提到 98%原文稍后读已读值得跟进有用关注 OpenAI
03:29官方一手@OpenAIDevs@OpenAIDevs74°OpenAI 推出新功能,Codex Code Review 现在支持在 AGENTS.md 文件中定义自定义仓库规则。用户可以将审查者反复提到的常见问题写为简洁规则,让 Codex 捕获仓库特定问题,即使相关上下文被隔离。该功能提升了代码审查的准确性和针对性。AI产品CodexOpenAI代码审查10 个信源在谈事件专题推荐理由:Codex 代码审查现在能用 AGENTS.md 配置你的仓库专属规则了。把团队常见的检查点写进去,Codex 就能帮你自动抓私有仓库的特有问题。原文稍后读已读值得跟进有用关注 Codex
00:39coderabbitai@coderabbitaiChange Stack 现已在 BitBucket Cloud 和 BitBucket Data Center 上可用。用户可通过 Review Change Stack 按钮打开 Change Stack。具有仓库写入权限的审查者可以运行交互审查操作和编码代理任务。AI产品Change StackBitBucket代码审查推荐理由:BitBucket 用户现在可以直接用 Change Stack 做代码审查,还能让 AI 帮你跑自动化任务,很实用。原文稍后读已读值得跟进有用关注 Change Stack
12:58官方一手Claude Code: GitHub Releases@ashwin-antClaude Code v2.1.215 取消了自动运行 /verify 和 /code-review 技能的机制。用户现在需要通过明确输入 /verify 或 /code-review 命令来主动触发代码验证和审查。这一改动避免了不必要的自动检查,让开发者按需调用。AI产品Claude CodeAnthropic代码审查10 个信源在谈事件专题推荐理由:Claude Code 新版改了,自动校验和审查不再自动跑,需要你手动调用了。原文稍后读已读值得跟进有用关注 Claude Code
00:52官方一手GitHub Blog@Napalys Klicius精选GitHub团队发现,为Copilot代码审查引入更强大的工具反而导致性能下降。他们将Copilot的代码审查工作流迁移到共享Unix风格代码探索工具,并围绕pull request证据重构agent流程。这一改进显著降低了代码审查成本,提升了审查效率。技巧GitHub Copilot代码审查工作流优化推荐理由:GitHub分享了改进Copilot代码审查的真实案例:不用更花哨的工具,而是用共享Unix工具调整工作流,成本确实降了。原文稍后读已读值得跟进有用关注 GitHub Copilot
03:15coderabbitai@coderabbitaiCodeRabbit测试了GPT-5.6的两个变体Sol和Terra。Sol在遵循长任务、保持仓库上下文和代码审查基准中展现了更好的召回。Terra作为更便宜的选项适用于小范围工作。报告对比了Fable 5和Opus 4.8的定价与性能。AI模型GPT-5.6CodeRabbit编码代理推荐理由:CodeRabbit实测了GPT-5.6的两个版本,Sol在代码审查中召回更强,Terra则更省钱。对比Fable 5和Opus 4.8,想升级编码工具可以看。原文稍后读已读值得跟进有用关注 GPT-5.6
01:41宝玉@dotey本文区分了两种AI写代码场景:原型代码无需审查,生产代码必须审查。作者类比传统软件工程,指出瀑布模型因集成颗粒度大导致痛苦,而敏捷开发的持续集成(Continuous Integration)通过小功能点频繁集成配合自动化测试解决了问题。建议Vibe Coding时一次只让AI做一个小功能或修一个小bug,便于验收和审查,保证质量。技巧Vibe Coding持续集成AI编程推荐理由:如果你用AI写代码总是一次生成一大坨,看不过来还容易出bug,这篇用持续集成的思路,教你怎么让AI一次只改一小点,好验收好纠错。原文稍后读已读值得跟进有用关注 Vibe Coding
01:39The Rundown AI@therundownai精选DoorDash 发布 DashBench 测试,用 105 个历史代码变更评估 AI 代码审查。双模型架构中,Kimi K2.6 负责快速扫描,Claude Fable 5 深入分析。组合方案捕获 65.2% 的真实问题(全 Anthropic 方案为 53.6%),并抓住 8/10 的关键 bug。成本从每变更 $3.91 降至 $3.81。AI模型DoorDashKimi K2.6Claude Fable 510 个信源在谈事件专题推荐理由:DoorDash 搞了个新基准,用开源 Kimi K2.6 配合 Claude,更便宜还能多抓 bug,做代码审查的可以试试这个搭配。原文稍后读已读值得跟进有用关注 DoorDash
06:48cat@_catwu精选Anthropic发布了内部工具Claude Tag,覆盖工程、产品、数据、销售、营销等团队。该工具内部版本能实现65%的产品pull request成功落地。CEO和CTO分享了从Claude Code到Claude Tag的演进路径及安全设计原则。Claude Fable 5模型现已集成到Claude Tag中。AI产品Claude TagClaude CodeAnthropic10 个信源在谈事件专题推荐理由:Anthropic搞了个内部神器Claude Tag,能让65%的PR直接过,从CEO到码农都在用,还有Claude Fable 5加持,生产力直接起飞。原文稍后读已读值得跟进有用关注 Claude Tag
04:32coderabbitai@coderabbitaiCodeRabbit AI 对 Claude Sonnet 5 进行了代码审查基准测试。结果发现,该模型在生成更干净的评论方面表现突出,评论精度相比前代提升约9%。模型展现出更深层的思考能力,并在编码技能上有所增强。完整评测细节已在下方链接中公布。AI模型Claude Sonnet 5代码审查推理模型推荐理由:CodeRabbit AI 跑了 Claude Sonnet 5 的代码审查评测,评论精度提了9%,编码更聪明,值得看看细节。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
08:30coderabbitai@coderabbitai精选两年前业界普遍认为AI将加速代码审查,实现同等工作更短时间。实际数据反驳了这一假设:AI审查发现的问题数量增加约1.7倍,逻辑错误增加75%,安全漏洞增加约2倍。代码审查的瓶颈从编写转移到了审查环节。行业代码审查AI效率安全漏洞推荐理由:别以为AI真能帮你省时间——数据说反而多了1.7倍的问题和两倍的漏洞,搞代码的要警惕这个新瓶颈。原文稍后读已读值得跟进有用关注 代码审查
16:32coderabbitai@coderabbitaiCodeRabbit发布了其AI代码审查Agent的Discord集成。原本用于审查GitHub PR的代码审查工具现在可以直接在Discord社区内部使用。这一更新让团队无需切换平台即可获得自动代码审查反馈。CodeRabbit Agent能够分析代码变更、提供建议并在Discord中实时讨论。AI产品CodeRabbitDiscord代码审查推荐理由:CodeRabbit把PR审查机器人搬进Discord了,你们社区可以直接在聊天里审代码,不用来回切窗口。原文稍后读已读值得跟进有用关注 CodeRabbit
07:04GitHub@githubGitHub宣布Copilot代码审查功能现已支持AGENTS.md文件。开发者可在仓库根目录放置AGENTS.md,写入命名约定、安全规则等自定义指令。Copilot会读取该文件,使审查反馈更符合项目规范。这项改进让审查结果更具上下文感知能力,无需手动另设规则。AI产品CopilotGitHubAGENTS.md推荐理由:GitHub Copilot现在能读你项目里的AGENTS.md文件,代码审查会更懂你的命名习惯和安全规则,不用再手动调规则了。原文稍后读已读值得跟进有用关注 Copilot
22:23elvis@omarsar0QodoAI 发布了 Cross Repo Review 功能,用于检测跨仓库代码变更引发的连锁 bug。该功能不局限于单次提交的变更,而是追踪三个仓库之外的潜在影响。作者在个人 repo 上测试,成功捕获了传统工具遗漏的跨仓库依赖问题。这一更新解决了多仓库协作中的常见痛点。AI产品QodoAICross Repo Review代码审查推荐理由:QodoAI 的新功能能帮你发现跨仓库的隐式 bug,比只看单次变更的工具有用得多。原文稍后读已读值得跟进有用关注 QodoAI
12:52Ate-a-Pi@svpino如果你还在人工审查全部AI生成的代码,那说明效率太低。代码审查已成为软件开发的最大瓶颈。Santiago Valdarrama(@svpino)分享了改进方法,核心是减少审查范围、使用自动化工具、建立信任机制。他建议只审查关键路径代码,利用AI辅助审查,并逐步放宽对低风险代码的审查比例。技巧代码生成AI编程代码审查推荐理由:Santiago Valdarrama说别傻了,100%审查AI代码拖慢整个团队。他给了具体改进策略:缩小审查范围、用工具自动化,让开发快起来。原文稍后读已读值得跟进有用关注 代码生成
12:34官方一手arXiv: OpenAI@Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen一项基于AIDev数据集的长达七个月的纵向分析(400名重复审查者,共11,429条审查记录)发现,审查者对AI生成代码的批准率从30.1%上升至36.8%(Wilcoxon符号秩检验p<10^{-6})。随经验增加,批准率累计差距达14.5个百分点。与此同时,行内评论量下降22%(p=0.0014),但审查延迟增加3.5倍。这种模式提示审查者可能因工作负荷而产生习惯性麻木,而非理性信任调整。论文GitHub CopilotDevinOpenAI Codex2 个信源在谈事件专题推荐理由:这篇论文用真实数据告诉你,人类审查AI代码时会越来越松懈——批准率涨了,评论却少了。做AI代码审核的团队应该看看。原文稍后读已读值得跟进有用关注 GitHub Copilot