8月27日
09:23
09:23官方一手arXiv: DeepSeek@Zhuo Chen, Boyang Wang, Xiyue Zhang, Xiaoyun Xu, Ahmad-Reza Sadeghi, Stjepan Picek, Lichao Wu
自动代码审查工具在拉取请求中越来越受欢迎,但评估通常只测量它们是否阻止恶意更改。一个阻止可能是由一个无关的问题触发的,而不是使PR不安全的漏洞;修复报告的问题可能会使目标缺陷可利用。我们将这种差异称为判决-诊断(VD)差距。我们提出了MalPR-Bench,这是一个基于机制的基准,包含89个恶意PR和50个配对的良性控制,涵盖44个存储库和8个语言家族。每个恶意案例都有一个预先提交的规范,指定目标漏洞、接受的机制描述、所需的存储库证据和未获得信用分的离目标发现。审查分别对判决正确性、目标漏洞识别和证据验证进行评分;一个可归因的阻止需要所有三个。我们引入了PRGuard,这是一个可归因的PR安全审查器,它使用确定性、非执行工具和有界检索来构建候选漏洞并验证其前提与存储库证据。在31个常见覆盖率保留的恶意PR中,PRGuard和CodeRabbit的阻止总数相似(22/31与24/31),但PRGuard识别出22个目标漏洞,而CodeRabbit为16个,相差1.38倍。在14个缺失类型的情况下,两者都阻止了9个,而PRGuard识别出9个目标,而CodeRabbit为3个。当所需证据位于所触及的文件中时,CodeRabbit识别出16/24个目标,而当验证需要证据在它们之外时,为0/7。最后,PRGuard在五个项目中发现了十二个以前未公开的、基于概念验证的漏洞。PRGuard/DeepSeek和CodeRabbit都阻止了10/12个发现PR,但分别产生了10/12和4/12个可归因的阻止。因此,仅判决的评估可能会大大高估自动化审查的安全价值。
推荐理由:这篇论文提出了一个名为PRGuard的新工具,用于评估自动代码审查工具在拉取请求中的安全价值,与现有工具相比,它能够更准确地识别目标漏洞,值得一看。
8月26日
10:33
8月25日
15:48
5月27日
16:32
16:32AI Will@FinanceYF5
76°
Anthropic 为 Claude Code 推出安全审查插件,在文件编辑时检测危险模式、模型响应后扫描完整 diff、提交时验证上下文漏洞。内测数据显示 PR 安全问题下降 30-40%。该插件现已全量开放,可通过 /plugins 直接安装。
事件专题

推荐理由:做代码审查或 CI/CD 的团队终于有了 AI 原生安全防线——Claude Code 插件在编辑、响应、提交三阶段拦截漏洞,PR 安全问题直接降三成,建议有安全合规需求的开发者装上试试。
5月16日
13:46
13:46官方账号Greg Brockman@gdb
72°
Peter Steinberger 在 X 上分享了他如何在 OpenClaw 项目中大规模使用 AI 自动化。他每天在云端运行约 100 个 Codex 实例,覆盖代码审查、安全扫描、问题去重、自动修复、性能基准测试、会议监听等场景。这种模式让团队能以极精简的人力高效运作,展示了未来软件开发的趋势——当 token 成本不再成为瓶颈时,AI 可以深度嵌入开发流程的每个环节。
事件专题

推荐理由:这展示了 AI 在软件开发中的极致自动化实践,做开源项目或小团队开发的可以直接参考——100 个 Codex 实例帮你搞定 PR 审查、安全扫描、问题自动修复,省下大量人力。