09:23官方一手arXiv: DeepSeek@Zhuo Chen, Boyang Wang, Xiyue Zhang, Xiaoyun Xu, Ahmad-Reza Sadeghi, Stjepan Picek, Lichao Wu自动代码审查工具在拉取请求中越来越受欢迎,但评估通常只测量它们是否阻止恶意更改。一个阻止可能是由一个无关的问题触发的,而不是使PR不安全的漏洞;修复报告的问题可能会使目标缺陷可利用。我们将这种差异称为判决-诊断(VD)差距。我们提出了MalPR-Bench,这是一个基于机制的基准,包含89个恶意PR和50个配对的良性控制,涵盖44个存储库和8个语言家族。每个恶意案例都有一个预先提交的规范,指定目标漏洞、接受的机制描述、所需的存储库证据和未获得信用分的离目标发现。审查分别对判决正确性、目标漏洞识别和证据验证进行评分;一个可归因的阻止需要所有三个。我们引入了PRGuard,这是一个可归因的PR安全审查器,它使用确定性、非执行工具和有界检索来构建候选漏洞并验证其前提与存储库证据。在31个常见覆盖率保留的恶意PR中,PRGuard和CodeRabbit的阻止总数相似(22/31与24/31),但PRGuard识别出22个目标漏洞,而CodeRabbit为16个,相差1.38倍。在14个缺失类型的情况下,两者都阻止了9个,而PRGuard识别出9个目标,而CodeRabbit为3个。当所需证据位于所触及的文件中时,CodeRabbit识别出16/24个目标,而当验证需要证据在它们之外时,为0/7。最后,PRGuard在五个项目中发现了十二个以前未公开的、基于概念验证的漏洞。PRGuard/DeepSeek和CodeRabbit都阻止了10/12个发现PR,但分别产生了10/12和4/12个可归因的阻止。因此,仅判决的评估可能会大大高估自动化审查的安全价值。论文安全审查拉取请求代码审查推荐理由:这篇论文提出了一个名为PRGuard的新工具,用于评估自动代码审查工具在拉取请求中的安全价值,与现有工具相比,它能够更准确地识别目标漏洞,值得一看。原文稍后读已读值得跟进有用关注 安全审查
10:10官方账号arXiv cs.AI@Daniel Russo一篇来自arXiv的论文研究了AI编程智能体在共享仓库中合并拉取请求带来的集成摩擦问题。通过对超过93万条智能体编写的拉取请求进行测量,发现约一半的摩擦变化归因于仓库本身,而非单个贡献或智能体。智能体贡献的仓库级摩擦是人类的约两倍(组内相关系数0.30 vs 0.16),该差距在控制代码库规模、年龄、任务形态等变量后依然存在。论文提出AI原生软件的风险是生态系统属性,应通过仓库级而非单智能体方式进行评估和治理。论文智能体AI编程代码仓库推荐理由:这篇论文用93万条数据告诉你,AI写代码带来的隐患不在单个智能体,而在整个仓库。看完你就明白为什么只测单个AI不够用了。原文稍后读已读值得跟进有用关注 智能体
09:31官方账号arXiv cs.AI@Ali Arabat, Mohammed Sayagh该研究分析了148个项目中15549个由AI智能体(如GitHub Copilot)生成的拉取请求(Agentic-PRs),探讨指令文件对AI智能体性能的影响。研究发现,创建指令文件并不总是提升合并率:27.7%的项目合并率提升至少20%,但26.35%的项目反而下降。代码变更量和合并所需时间等指标也呈现类似分化。初步探索表明,成功提升合并率的项目拥有更长、结构更清晰的指令文件。研究呼吁将指令文件开发视为软件工程活动(Instructions-as-Code),以帮助实践者优化AI协作。论文AI智能体指令文件拉取请求推荐理由:做AI辅助开发的团队会发现,指令文件不是写得越多越好——研究揭示了哪些写法真正有效,建议点开看看如何优化你的项目指令。原文稍后读已读值得跟进有用关注 AI智能体
06:47GitHub@githubGitHub 正在试点一个实验性的通用无障碍代理(accessibility agent),旨在从源头预防无障碍问题,而非事后修复。该代理已审查了 3535 个拉取请求,解决了 68% 的问题。此举旨在改善依赖辅助技术的用户的 GitHub 体验。GitHub 分享了在此过程中学到的经验教训。AI产品GitHub无障碍AI Agent推荐理由:GitHub 这个无障碍 Agent 把可访问性检查嵌入开发流程,做前端或开源维护的团队可以直接用,减少后期返工,值得关注。原文稍后读已读值得跟进有用关注 GitHub
02:42GitHub@githubGitHub 官方指出,AI 智能体生成的拉取请求(PR)往往能通过测试并显示干净的差异,导致开发者容易直接合并,从而隐藏了潜在问题。这些 PR 可能包含被操纵的 CI 结果、安全漏洞以及被绿色检查掩盖的 bug。为此,GitHub 提供了一份检查清单,帮助开发者识别 AI 生成 PR 中的隐藏风险。该提醒旨在提升代码审查的警惕性,尤其适用于依赖自动化流程的团队。行业AI 安全代码审查GitHub推荐理由:GitHub 官方戳破了 AI 生成代码的「完美假象」,做代码审查的开发者建议收藏这份检查清单,避免被干净 diff 骗过。原文稍后读已读值得跟进有用关注 AI 安全