06:50官方一手@OpenAIDevs@OpenAIDevs72°OpenAI 宣布其前沿模型和 Codex 已在 Amazon Bedrock 上正式可用。企业现在可以在 AWS 环境中直接使用 OpenAI 模型构建 AI 应用和软件工程工作流,同时利用 AWS 已有的安全、合规和治理控制。这是 OpenAI 在 AWS 上扩展能力的开端,未来还将包括 Daybreak 等网络安全功能。此举让企业无需离开 AWS 生态即可调用 OpenAI 模型,简化了部署和合规流程。AI产品OpenAICodexAWS Bedrock10 个信源在谈事件专题推荐理由:AWS 用户终于可以在熟悉的云环境中直接调用 OpenAI 模型和 Codex,省去跨平台集成的麻烦。做 AI 应用开发或软件工程自动化的团队,建议关注这个新入口。原文稍后读已读值得跟进有用关注 OpenAI
05:21rohanpaul_ai@rohanpaul_ai72°Datacurve 推出 DeepSWE,一个更严格的编程基准测试,旨在揭示领先模型之间的真实差距。GPT-5.5 得分 70%,而 GPT-5.4 为 56%,Claude Opus 4.7 为 54%,差距在旧基准中常被掩盖。DeepSWE 使用原创任务而非公开 GitHub 问题,避免模型训练时见过答案。其提示词长度仅为 SWE-bench Pro 的一半,但解决方案需要 5.5 倍代码量和约 2 倍输出 token。评分方式也不同,DeepSWE 检查请求行为是否真正实现,而非仅依赖合并 PR 的测试。AI模型基准测试编程能力GPT-5.51 个信源在谈事件专题推荐理由:做 AI 模型评估或选型的团队,DeepSWE 能帮你看到模型在长周期软件工程任务上的真实差距,建议关注这个新基准。原文稍后读已读值得跟进有用关注 基准测试
11:44官方账号arXiv cs.AI@Bar Weiss, Antonio Abu-Nassar, Adi Sosnovich, Karen Yorav本文提出了一种基于大语言模型的两阶段流水线,用于对代码补丁中的变更进行结构化标签标注(如重命名、移动、逻辑修改等),以提升代码审查效率。该方法先对diff块进行标签分配,再精炼以捕捉结构关系和语义属性,采用少样本提示实现语言无关和可定制的标签,无需传统静态分析管线的工程开销。在人工标注的基准上,最佳配置达到了84%的召回率和81%的精确度。研究表明,LLM标签标注能有效补充静态分析,支持灵活、多语言、可自动化的代码审查工作流。论文代码审查大语言模型结构化标签推荐理由:代码审查团队终于有了更智能的辅助——LLM自动标注变更类型(重命名/移动/逻辑修改),比人工逐行看diff高效太多,做代码审查或CI/CD集成的开发者可以直接参考。原文稍后读已读值得跟进有用关注 代码审查
10:44官方一手arXiv: DeepSeek@Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma, Jinbo Wang, Mengdi Zhang, Kai Zhang, Zhenya Huang精选SWE-Mutation 是一个新基准,用于评估大语言模型(LLM)生成的测试套件的质量。它通过引入系统性的变异解决方案来“欺骗”测试套件,从而衡量测试套件的判别能力。该基准包含从800个原始实例衍生的2,636个变异变体,并覆盖九种编程语言。实验表明,即使是DeepSeek-V3.1,其验证率也仅为10.20%,检测率为36.15%,暴露了当前LLM在生成可靠测试套件方面的严重不足。该研究还提出了一种智能体驱动的变异策略,使测试套件更难被欺骗,从而更真实地反映LLM的能力缺陷。论文LLM评估测试套件软件工程推荐理由:软件工程团队和AI研究者终于有了一个严谨的测试套件质量评估工具——SWE-Mutation能帮你判断LLM生成的测试是否真的可靠,做自动化测试或代码修复的开发者值得关注。原文稍后读已读值得跟进有用关注 LLM评估
08:00Scott Wu@ScottWu46Cognition 创始人 Scott Wu 发推感谢与 Anthropic 团队的深度合作,并调侃自己中学数学视频被 Claude 记住。他领导的团队基于 Claude 构建了 AI 软件工程师 Devin,目标是让每个工程团队的软件开发速度提升 10 倍。Devin 能自主规划、编写代码、调试并部署,代表了 AI 编程助手从辅助到自主的重大转变。这条推文引发广泛关注,显示 AI 编程工具正加速进入工程团队日常。AI产品AI 编程助手DevinClaude10 个信源在谈事件专题推荐理由:Devin 基于 Claude 实现了从辅助到自主编程的跨越,做软件工程的团队值得关注——它可能改变你每天写代码的方式。原文稍后读已读值得跟进有用关注 AI 编程助手
22:25Y Combinator@ycombinator73°Y Combinator 邀请 RevenueCat、Greptile、Firecrawl、Infisical、Ollama、Resend、Mintlify、UnslothAI、Porter、Recall 等 12 家 DevTool 公司的创始人,围绕 AI 智能体现状和软件工程未来展开深度对话。讨论涵盖智能体作为客户、编码是否终结、创始人早期常见错误、最意外的 AI 发现、当前被低估的方向以及未来预测。创始人们的观点可能出乎你的意料。视频全长约 15 分钟,涵盖 7 个主题章节。行业AI 智能体DevTool软件工程推荐理由:12 位一线 DevTool 创始人亲述智能体趋势和踩坑经验,做开发者工具或 AI 应用的团队看完会有共鸣,建议直接看视频。原文稍后读已读值得跟进有用关注 AI 智能体
13:27官方账号arXiv cs.AI@Mohammad Reza Mousavi精选一项新研究测试了 Gemini-3、GPT-5.4 和 Qwen-3.6 三个大模型对高级消息序列图(HMSC)语义的理解能力。HMSC 是 UML 序列图的基础,具有严格的形式语义。研究设计了 129 个语义任务,涵盖基本语义查询、抽象与组合、迹与标签转移系统计算。结果显示,LLM 整体准确率仅约 52%,其中基本语义理解较好(88%),但抽象与组合任务(36%)和迹与 LTS 任务(42%)表现很差。所有模型都未能理解共区域和显式因果依赖等概念。这表明 LLM 在形式化软件工程任务上仍有显著局限。论文LLM形式语义软件工程推荐理由:做形式化方法或软件建模的开发者会发现,LLM 对 UML 序列图语义的理解远不如预期,依赖 LLM 生成设计文档时需谨慎验证。原文稍后读已读值得跟进有用关注 LLM
19:11官方账号arXiv cs.AI@Roxana Geambasu, Mariana Raykova, Pierre Tholoniat, Trishita Tiwari, Lillian Tsai, Wen Zhang该论文指出当前AI智能体普遍采用的“即时合成”范式(on-the-fly loop)缺乏严谨的软件工程流程,如迭代设计、严格测试、对抗性评估和分阶段部署,导致实际输出如同“临时原型”,在高风险场景下不可靠。作者提出将软件工程引入智能体循环,打造经过硬化、有确定性约束的生产级agent workflow,并通过复用分摊成本。为此,他们构想了一个“AI Workflow Store”,即存放硬化且可复用的工作流库,智能体可调用这些工作流以显著提升可靠性。论文还探讨了灵活性-鲁棒性张力下的研究挑战。论文智能体AI安全软件工程推荐理由:该研究直击当前AI智能体可靠性不足的痛点,提出以工程化工作流复用替代即时合成,为构建生产级智能体系统提供了重要思路,对Agent落地高风险场景具有参考价值。原文稍后读已读值得跟进有用关注 智能体