09:20官方一手arXiv: DeepSeek@Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao ZhuCodeSpec提出双可执行规范方法,从子需求语义与仓库架构配对构建可靠功能链,并编译为互补的架构和行为规范。在FeatureBench上,使用DeepSeek-V4-Pro达到70.7%、55.0%和49.9%的通过率,优于Claude Code等基线。在NL2Repo-Bench上验证了泛化性。该方法通过可执行规范保证长周期开发中设计与实现的一致性。论文CodeSpecDeepSeek-V4-ProFeatureBench4 个信源在谈事件专题推荐理由:这篇论文搞了个CodeSpec,让代码智能体在仓库里加新功能时先建可执行规范,在FeatureBench上用DeepSeek-V4-Pro跑到70.7%通过率,比Claude Code靠谱不少。原文稍后读已读值得跟进有用关注 CodeSpec
00:15lmarena.ai@lmarena_ai82°Anthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中排名第二,基于超过 7000 次真实代理会话,净提升 11.88%。Opus 5 (High) 紧随其后排名第三,净提升 11.73%,两者均低于第一名 Fable 5,但高于 GPT-5.6 Sol (xHigh)。在 Frontend Code Arena 中,Opus 5 Max 排名第一,Opus 5 High 排名第三(落后于 Kimi K3)。在 Text Arena(事实性开启)中,Opus 5 Max 位列第一,Opus 5 High 第二。这些成绩基于全球社区的百万级真实长周期任务评测。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。原文稍后读已读值得跟进有用关注 Claude Opus 5
12:25官方账号arXiv cs.AI@Fabian Kreppel, Reza Salkhordeh, Ferdinand Schmidt-Kaler, André BrinkmannClaude Opus 4.7首次生成并迭代优化了离子阱穿梭编译器的完整Python代码,从线性分段陷阱扩展到有结架构,最终适用于广泛连接图。在基准量子电路测试中,线性架构的穿梭time steps减少76%,有结架构减少39%。对于密集连接、结丰富的架构,穿梭time steps比走廊式架构降低一个数量级。Claude Fable 5复现了结果,在大电路上超越手工编译器的次数更多。开发时间从数月缩短到数天。论文Claude Opus 4.7Claude Fable 5量子编译器2 个信源在谈事件专题推荐理由:论文用Claude Opus 4.7自动写量子穿梭编译器,性能超手工,开发时间从数月缩到数天,效率提升惊人。原文稍后读已读值得跟进有用关注 Claude Opus 4.7
12:14官方一手歸藏(guizang.ai)@op7418归藏推文称 Codex 今天可能会重置。目前尚无具体版本号或新功能细节。用户需留意后续官方更新或重置后的参数变化。该重置可能影响基于 Codex 的编程工作流。AI模型CodexOpenAI代码生成10 个信源在谈事件专题推荐理由:归藏说 Codex 要重置了,如果你在用 Codex 写代码,建议留意一下今天的变动。原文稍后读已读值得跟进有用关注 Codex
09:46官方账号arXiv cs.LG@Ishpuneet Singh, Shreyas Mahajan, Gurjot Singh, Maninder Singh一项研究评估了5款AI编码助手(如GitHub Copilot、Amazon CodeWhisperer等)在生成认证代码时的安全性,采用静态代码分析加动态渗透测试的双模态评估框架,并映射到NIST SP 800-63B标准。结果发现,基础或通用安全提示下生成的代码普遍缺少暴力破解防护、会话管理和密码处理等关键保护。即使给出一次性NIST提示,合规性虽有提升但仍结构不足。只有通过迭代重提示(Reprompting)迫使模型进行上下文自审计,才能实现完整的深度防御安全架构。研究证实当前AI编码助手无法默认生成安全代码,企业需从一次性提示转向持续、标准驱动的验证流程。论文LLMAI安全代码生成推荐理由:想了解AI写代码到底安不安全?这篇论文用具体基准和测试告诉你,目前主流的编码助手都靠不住,必须用迭代重提示才能堵上漏洞。原文稍后读已读值得跟进有用关注 LLM
12:15官方账号arXiv cs.AI@Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo LiMineValiCoder 提出一种协作闭环测试驱动开发(TDD)框架,包含三个模块:测试用例质量挖掘(TCQM)通过自验证过滤缺陷测试,并行TDD迭代优化生成高质量代码候选,二分图代码-测试互验(BiCoTeV)动态建模代码-测试交互进行可靠选择。在 HumanEval 上 Pass@1 达 96.34%,MBPP 上 87.40%,APPS 上 64.00%,LiveCodeBench 上 51.33%,显著优于现有方法。MineValiCoder 有效缓解了 LLM 随机性导致的不稳定代码生成问题。论文MineValiCoder测试驱动开发代码生成推荐理由:这篇论文用MineValiCoder框架搞定代码生成不可靠问题,HumanEval跑出96.34%通过率,比之前的方法强一截,搞LLM代码的同学值得看看。原文稍后读已读值得跟进有用关注 MineValiCoder
10:59官方账号NVIDIA AI@NVIDIAAI精选NVIDIA在代理芯片设计场景中测试了Nemotron 3 Ultra的RTL编码能力。该模型迭代编写芯片逻辑代码、通过仿真器运行、读取失败并重写。在九个真实设计工作类别中,Nemotron 3 Ultra平均通过率达97.1%,每次迭代消耗6629个tokens。这是测试中所有开源模型里表现最好的。AI模型Nemotron 3 UltraNVIDIARTL编码10 个信源在谈事件专题推荐理由:NVIDIA测了Nemotron 3 Ultra在芯片设计RTL编码上的表现,九类任务平均通过率97.1%,开源模型里最强,值得关注。原文稍后读已读值得跟进有用关注 Nemotron 3 Ultra
07:18官方一手AWS Machine Learning Blog@Sandeep SinghAmazon Bedrock Guardrails可配置为代码生成工作流加入安全防护,防止生成有害或不合规代码。本文详细介绍了如何结合编码助手(如Amazon Q Developer)设置内容过滤器、敏感信息屏蔽和主题限制。通过实施这些最佳实践,企业能实现有效的容量规划并确保安全覆盖。文中还提供了示例策略和配置步骤,帮助开发者快速落地。技巧Amazon BedrockGuardrails代码生成推荐理由:AWS官方教你给代码生成加护栏,用Bedrock Guardrails防有害代码,还能规划容量,适合用编程助手的人。原文稍后读已读值得跟进有用关注 Amazon Bedrock
01:15Lovable@lovable_devAI 开发平台 Lovable 今日宣布获得 AIUC-1 认证,该标准由 AI Underwriting 制定,是业界领先的第三方 AI 安全、可靠性和安全性基准。认证过程包括对不安全代码生成、密钥泄露等风险的压测。Lovable 成为首批通过该认证的平台之一。行业LovableAIUC-1AI安全推荐理由:Lovable 拿到了 AIUC-1 安全认证,意味着它过了一道严格的代码安全测试关,用着放心。原文稍后读已读值得跟进有用关注 Lovable
09:59IT之家(博客/媒体)85°月之暗面于7月16日上线Kimi K3模型,拥有2.8万亿参数。在Frontend Code Arena榜单中,Kimi K3以1679分超越Claude Fable 5位列第一。月之暗面企业业务负责人黄震昕表示K3性能提升源于底层原创架构创新,并非对任何现有模型蒸馏复刻。埃隆·马斯克在相关评测下留言“Impressive”表示关注。目前K3全平台资源紧张,团队暂缓新用户注册,优先保障付费老用户使用体验。AI模型Kimi K3月之暗面Claude Fable 510 个信源在谈事件专题推荐理由:月之暗面发了Kimi K3,2.8万亿参数,代码榜拿第一,还声明是自研不是蒸馏。马斯克都点赞了,但新用户暂时注册不了。原文稍后读已读值得跟进有用关注 Kimi K3
09:57GitHub@githubGitHub 博客指出,AI 大幅降低了生成初始代码(first patch)的成本,但代码的长期维护、理解和风险定价费用并未同步下降。对于小规模、边界明确的需求,团队可以用实际 diff 替代无休止的范围争论,基于证据评估风险再做决策。文章建议组织重新审视说“是”和说“不”的成本结构,以适应 AI 辅助编程的新常态。行业GitHub代码生成AI编码推荐理由:GitHub 博客给了个新视角:别只盯着AI写代码多快,想想之后修 bug 和改代码要花多少钱。原文稍后读已读值得跟进有用关注 GitHub
18:13Hunyuan@TXhunyuan腾讯混元发布Hy3模型,在Arena.ai的Agent Arena中位列总榜第25名,开源权重模型中排第5。在Frontend Code Arena中排名开源模型第2、总榜第16。Agent Arena基于百万级真实长周期智能体任务评测,Hy3在工具使用(CLI/bash错误恢复)上净提升+2.6%,排名第25;可操纵性是其最大弱点,净提升-7.1%,排名第30。AI模型Hy3Tencent HunyuanAgent Arena推荐理由:腾讯混元Hy3在Agent Arena和代码榜单上表现不错,工具使用能力尤其突出,适合关注开源智能体模型的朋友看。原文稍后读已读值得跟进有用关注 Hy3
06:43lmarena.ai@lmarena_aiChatbot Arena 推出了 Agent Arena 和 Frontend Code Arena 两个新排行榜。Agent Arena 评估 AI 智能体在真实世界任务中的表现,Frontend Code Arena 专门评测模型的前端代码生成能力。排行榜数据来自用户对战投票,结果实时更新在 arena.ai 上。AI模型Agent ArenaFrontend Code Arena智能体推荐理由:想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。原文稍后读已读值得跟进有用关注 Agent Arena
01:30官方账号Google DeepMind@GoogleDeepMind72°Google DeepMind 发布 Gemini 3.6 Flash,该模型在生成生产级代码时速度更快且不易陷入循环。同时,它在多模态任务上表现出色,可分析图表、理解文档并起草报告。Gemini 3.6 Flash 已在 Gemini App 中逐步推送,开发者可通过 Antigravity、Google AI Studio 和 Android Studio 获取 API 访问。AI模型Gemini 3.6 FlashGoogle DeepMind代码生成10 个信源在谈事件专题推荐理由:Gemini 3.6 Flash 写代码不卡壳了,还能读图表写报告,开发者可以马上在 Android Studio 里试。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
16:10AI Will@FinanceYF5Kimi-K3在Arena AI前端代码竞技场获得1679分,超过Claude Fable 5的1631分。这是中国模型首次在该竞技场超越美国模型。上一次中国模型逼近该位置是2025年初的DeepSeek-R1。该结果由中国AI公司月之暗面推出。AI模型Kimi-K3Claude Fable 5Arena AI10 个信源在谈事件专题推荐理由:Kimi-K3在代码竞技场拿了1679分,比Claude Fable 5高48分,中国模型第一次赢美国模型,可以看看。原文稍后读已读值得跟进有用关注 Kimi-K3
12:45Sahil Lavingia@shlSahil Lavingia 表示其公司中 AI 编程助手 Devin 已承担 41% 的 Pull Request 编写工作。人类开发者负责决定构建内容并审查所有合并请求,但 AI 应尽可能多地编写代码。Lavingia 预计到明年底 Devin 将负责 80% 的 PR。AI产品DevinSahil Lavingia编程助手推荐理由:Sahil Lavingia 分享了他公司用 Devin 写代码的真实数据:41% 的 PR 由 AI 完成,明年还要翻倍。AI 编码已经不是概念了。原文稍后读已读值得跟进有用关注 Devin
12:23官方账号arXiv cs.AI@Alex Mathai, Shobini Iyer, Aleksandr Nogikh, Petros Maniatis, Franjo Ivancic, Junfeng Yang, Baishakhi Ray论文定义了CodeSlop现象,即AI编码代理在搜索过程中残留的冗余编辑。提出TRIM算法,通过最小化代理轨迹来间接减少CodeSlop。实验在多种代理框架上测试,CodeSlop降低17.9%-32.9%,性能几乎无损失。验证成本仅为Delta Debugging算法的约一半。论文TRIMCodeSlop代码生成推荐理由:这篇论文发现AI助手写代码越来越啰嗦,还给出了一个叫TRIM的清理方法,能减少17%到33%的冗余,实测效率高,推荐给写代码的朋友。原文稍后读已读值得跟进有用关注 TRIM
01:52官方账号Cursor@cursor_ai一个AI智能体团队基于SQLite的835页官方手册,成功重建出Rust语言副本。该副本在保留测试套件中通过率达到100%。成本因使用的模型组合不同而波动,最高差距达15倍。实验展示了多智能体协作在复杂代码重构中的潜力。AI模型SQLiteRust智能体3 个信源在谈事件专题推荐理由:看看AI智能体怎么读835页手册,把SQLite用Rust重写了一遍,还100%过测试,成本差15倍挺有意思。原文稍后读已读值得跟进有用关注 SQLite
06:20Cognition@cognition_labsCognition发布FrontierCode排行榜,专门评估模型生成可合并代码的能力。榜单包含Grok 4.5、Inkling等模型的得分。官方提供了完整的评分方法和示例任务。AI模型FrontierCodeGrok 4.5Inkling10 个信源在谈事件专题推荐理由:想知道哪个AI写代码最靠谱?FrontierCode榜单直接告诉你哪些模型写的代码能直接合并。原文稍后读已读值得跟进有用关注 FrontierCode
12:17AI Will@FinanceYF572°Kimi 发布了 K3 模型,结合 3D 推理、编程和视觉理解能力。它能够将文本概念、图片或视频转化为可玩的交互式 3D 体验。K3 实现了"vision in the loop"机制,模型可在代码和实时截图之间来回迭代。AI模型K3Kimi多模态推荐理由:Kimi 刚发了 K3,能把图片视频转成可交互 3D,还能边写代码边看效果,挺实用的。原文稍后读已读值得跟进有用关注 K3
11:22官方一手arXiv: DeepSeek@Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo该研究分析了GPT-4o mini、DeepSeek和Claude在460个编程任务(Python和Java各230个)上的代码生成质量,将英文提示翻译并人工校订为中文、印地语、西班牙语和意大利语。通过测试通过率、代码度量标准和静态分析工具评估,发现英文提示并非总能产生最佳功能正确性或代码质量,提示语言的影响取决于编程语言和LLM,且生成的代码常在注释和字符串中混合英语与提示语言。这是首个用于研究代码生成中语言偏差的精选多语言基准。论文GPT-4o miniDeepSeekClaude推荐理由:想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。原文稍后读已读值得跟进有用关注 GPT-4o mini
04:17lmarena.ai@lmarena_ai精选72°Kimi K3 在 Code Arena 前端榜单以 1679 分超越 Claude Fable 5 升至第一,排名从 Kimi-k2.6 的第 18 位跃升 17 位。在 Brand & Marketing、Reference-Based Design 等 6 个领域排名第一,仅在 Gaming 领域落后 Fable 5 列第二。模型权重将于 7 月 27 日开源。AI模型Kimi K3Kimi_MoonshotClaude Fable 510 个信源在谈事件专题推荐理由:Kimi 新模型在前端代码上把 Claude Fable 5 比下去了,六个子项都排第一,而且权重会开源,值得试试。原文稍后读已读值得跟进有用关注 Kimi K3
03:27lmarena.ai@lmarena_ai精选78°Kimi_Moonshot 发布的 Kimi-K3 模型在 Frontend Code Arena 中以 1679 分排名第一,超越 Claude Fable 5。相比此前第 18 名的 Kimi-k2.6 跃升 17 位。在 Brand & Marketing 等 6 个领域中均排名第一,仅 Gaming 领域位居第二。完整模型权重将于 7 月 27 日前开源。AI模型Kimi-K3Kimi_MoonshotClaude Fable 510 个信源在谈事件专题推荐理由:Kimi-K3 刚把 Claude Fable 5 从第一拉下来,前端代码评测全面领先,很快还会开源权重,玩编程的可以关注。原文稍后读已读值得跟进有用关注 Kimi-K3
09:38官方账号arXiv cs.AI@Niels Mündler-Sasahara, Hristo Venev, Dawn Song, Martin Vechev, Jingxuan He精选本研究提出生成式编译(Generative Compilation),其核心设备sealor能将部分程序转换为完整程序,使标准编译器可诊断。在核心Rust-like演算上形式化证明了sealor满足不拒绝可能完成的部分程序等性质,并扩展到真实Rust。在仓库级Rust编程任务上,相比传统后生成反馈,该方法减少了非编译输出数量并提升了功能正确性。论文RustGenerative Compilationsealor推荐理由:这篇论文让编译器在AI写Rust代码时实时纠错,而不是写完再报错,对写复杂项目特别有用。原文稍后读已读值得跟进有用关注 Rust
10:56官方账号arXiv cs.AI@Mehmet IscanPoPE(Popperian Placebo-Controlled Evaluation)是一种用于测量代码模型能否利用错误证据进行自修复的评估方法。在0.5-1.5B参数的冻结小型代码模型上,通过提示通道和权重通道(小数据适配器训练)进行测试。提示通道中,内容消融安慰剂组解锁12单元,真实错误模式组解锁10单元(40单元抗性带),未发现机制差异。权重通道中,错误内容适配器与无干预基线打成8-8平局(p=1.0),而SHA扰乱安慰剂适配器以10个解锁领先。结果未证实错误内容可带来显著优势。论文PoPE代码生成自我修复推荐理由:这篇论文用严格安慰剂对照方法戳穿了代码模型自修复的假设,在0.5-1.5B模型上实测发现错误内容并没带来明显改善,想了解模型能力边界可以看看。原文稍后读已读值得跟进有用关注 PoPE
08:01berryxia@berryxia77°ChatGPT现在支持用户用自然语言描述需求,自动生成包含前端、逻辑和交互的完整网页App。整个过程在聊天界面内完成,无需切换工具或手动配置。用户可以随时迭代修改,并直接部署上线。该功能将“想法”到“可用产品”的距离大幅缩短。AI产品ChatGPT网页App代码生成推荐理由:ChatGPT又升级了,你描述一个App功能,它就能自动写完整代码并帮你部署上线,一个人就能干整个团队的活。原文稍后读已读值得跟进有用关注 ChatGPT
03:33官方一手@OpenAIDevs@OpenAIDevsOpenAI开发者使用GPT-5.6从零构建了针对NotionHQ架构的模型评估命令行工具。该工具可自动化评估新模型在NotionHQ架构上的性能。这是GPT-5.6在具体工程任务中的一次实际应用展示。AI模型GPT-5.6NotionHQOpenAI10 个信源在谈事件专题推荐理由:OpenAI用GPT-5.6写了个命令行工具,专门给Notion架构跑模型评估,挺酷的原文稍后读已读值得跟进有用关注 GPT-5.6
22:48Martin Fowler@martinfowlerMartin Fowler 发布新文章,介绍 @unmeshjoshi 使用抽象和领域特定语言(DSL)来约束 LLM 代码生成的经验。通过为 LLM 设定明确边界,可减少生成代码中的错误。文章强调 DSL 能确保输出符合预期,提高代码质量。该方法适用于快速原型设计及生产级代码的生成。技巧Martin FowlerDSL领域特定语言推荐理由:Martin Fowler 分享了用 DSL 给 LLM 画好框框的技巧,能少踩不少坑,写代码更稳。原文稍后读已读值得跟进有用关注 Martin Fowler
16:44berryxia@berryxia用户使用GPT-5.6 Sol模型,仅用一句提示词,在10分钟内复刻了一个应用,成功还原了90%的功能。该模型展现出强大的代码生成和指令跟随能力。经过进一步调优,有望达到接近原版的效果。AI模型GPT-5.6 Sol编程助手代码生成推荐理由:GPT-5.6 Sol太强了,一句话加10分钟就能复刻90%功能,编程效率飞起!原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
11:03官方一手arXiv: DeepSeek@Tiancheng Ma, Nasir U. Eisty该研究基于Defects4J中10个真实bug(Lang 1、3-11),提出需求驱动流水线,比较5个LLM(DeepSeek-V3、Gemma-3n、Llama-3、Mistral-7B、Qwen-3)生成Java测试预言的正确性与泛化能力。实验表明LLM生成的预言与需求预言(REQ)的一致性高于与系统(SUT)的一致性,宏平均准确率、精确率、召回率和F1均报告,但不同bug和模型间方差显著。需求技术性/模糊性评分与预言准确率之间的相关性弱且置信区间宽,未发现可检测的线性关系。研究结论为初步可行性证明,旨在推动更大规模实证。论文Defects4JLLM测试预言推荐理由:这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。原文稍后读已读值得跟进有用关注 Defects4J
11:25Ethan Mollick@emollick这篇推文指出,当前AI模型(如Codex)在正确设置下能完成大量有用的代码工作,但很少有人了解其真实能力。作者认为AI公司在解释系统实际功能方面做得很差,导致用户错失了模型在代码生成、补全等场景的实用价值。内容批评了行业普遍的沟通问题,而非鼓励过早采用。行业CodexAI沟通代码生成推荐理由:这条推文点出了AI行业的一个通病:公司宣传抽象,用户用不起来。如果你常用代码模型,这段吐槽能帮你发现被忽略的实用技巧。原文稍后读已读值得跟进有用关注 Codex
10:59官方账号Together AI@togethercompute精选Together AI团队在@aiDotEngineer大会上发布了ParallelKernelBench,一个开源基准测试。该基准专门评估大语言模型能否为通信密集型多GPU工作负载编写高效的CUDA内核。与现有单GPU测试不同,ParallelKernelBench聚焦真实场景下的并行内核性能。开发者可使用该基准对比不同LLM的代码生成质量。AI模型ParallelKernelBenchTogether AICUDA推荐理由:Together AI搞了个新基准ParallelKernelBench,专门测AI写多GPU CUDA代码的能力,比单核测试更贴近真实场景。原文稍后读已读值得跟进有用关注 ParallelKernelBench
04:32官方一手@OpenAIDevs@OpenAIDevs精选GPT-5.6 在 SnorkelAI 的 Ankit Aich 测试中,独立完成了一个近 1000 行的复杂编码任务,无需反复提示或人工介入。该模型从编写到调试全程自主处理,展示了长上下文和复杂推理能力。测试结果在 OpenAI 开发者官方账号发布,获得 170 点赞和 20534 次查看。AI模型GPT-5.6OpenAI编程助手10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 能独立啃下近千行代码,不用你一步步教,编程助手又进化了。原文稍后读已读值得跟进有用关注 GPT-5.6
03:11lmarena.ai@lmarena_ai精选73°Muse Spark 1.1 在 Code Arena: Frontend 基准测试中排名第9,得分1541,混合成本350万美元(输入每百万token 1.25美元,输出每百万token 4.25美元)。Meta 称这款模型重塑了成本-性能帕累托前沿,以低廉价格提供前沿表现。同时,Meta 推出了新 Meta Model API 公开预览,开发者可通过该 API 访问 Muse Spark 1.1,模型也已在 Meta AI 应用的“Thinking”模式上线。AI模型Muse Spark 1.1Meta代码生成推荐理由:Meta 发了 Muse Spark 1.1,代码生成得分1541,成本只要350万美元,比同类便宜不少,适合做前端开发的玩家。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
02:45@koltregaskes@koltregaskesGPT-5.6 Sol max 和 xhigh 在 DeepSWE 排行榜上超过了 Fable 5 xhigh 和 max。两者的平均成本更低,输出 token 更少、步骤更少。GPT-5.6 Tera max 得分与 Fable 几乎相同。这些结果表明 GPT-5.6 系列在软件工程任务上具有竞争力。AI模型GPT-5.6DeepSWEFable 56 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 新变体在 DeepSWE 上干过了 Fable 5,还更便宜更快,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6
19:22官方账号Decoder@Maximilian Schreiner76°Bun这个JavaScript工具已从Zig完全重写为Rust,整个过程借助了Anthropic的Claude Fable 5模型。Fable 5在11天内生成了超过一百万行代码,完成了整个重写工作。这次重写展示了Claude Fable 5在大型代码迁移任务中的效率。Bun团队尚未公布具体性能对比数据,但表示新版本已通过测试。AI模型BunRustClaude Fable 510 个信源在谈事件专题推荐理由:Bun原来用Zig写的,现在直接换成Rust了,而且靠Claude Fable 5在11天里写了100多万行代码,这AI写代码的效率太吓人了。原文稍后读已读值得跟进有用关注 Bun
17:09Stanford AI Lab@StanfordAILab71°斯坦福AI实验室提出TRACE自我改进方法,智能体通过识别自身失败背后的缺失能力并进行针对性训练来提升。TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,超过Codex 5.2和GLM 5等更大模型,同时以少于1/4的训练rollout击败GRPO和GEPA。该工作已在ICML AIWILD获得Spotlight论文。AI模型TRACEQwen3.6-27BSWE-bench Verified推荐理由:斯坦福AI Lab搞了个新方法TRACE,让AI自己找短板补课。只用四分之一训练量就超过了GRPO和GEPA,还赢了大模型Codex 5.2和GLM 5。原文稍后读已读值得跟进有用关注 TRACE
09:52官方账号arXiv cs.AI@QiHong Chen, Aaron Imani, Iftekhar AhmedProjAgent 是一种针对仓库级代码生成的新系统,通过引入过程相似性作为检索信号来改善代码生成。它将目标函数分解为中间推理步骤,利用代理工作流检索具有类似过程行为的仓库函数,并与传统语义检索结合构建更丰富的上下文。在 REPOCOD 基准上,ProjAgent 实现了 41.14% 的 Pass@1,超越现有检索基线。结果表明过程相似性是一个此前未被探索的有效检索维度。论文ProjAgentREPOCOD代码生成推荐理由:这篇论文提出 ProjAgent,用过程相似性帮你找到仓库里逻辑相似的代码片段,在 REPOCOD 上 Pass@1 达到 41.14%,比传统语义检索强。原文稍后读已读值得跟进有用关注 ProjAgent
09:44Cognition@cognition_labsCognition 推出 SWE-1.7 模型,基于 Kimi K2.7 基座并改进强化学习流程。其自研 FrontierCode 基准测试关注代码合并意愿,SWE-1.7 在该基准 Main 集上取得 42.3% 的分数,每个任务成本降至 1.97 美元,优化了成本-性能帕累托曲线。AI模型SWE-1.7Kimi K2.7Cognition3 个信源在谈事件专题推荐理由:Cognition 新模型 SWE-1.7 基于 Kimi K2.7 用强化学习改进,FrontierCode 基准上 42.3% 分且每任务仅 1.97 美元,性价比突出。原文稍后读已读值得跟进有用关注 SWE-1.7
12:49IT之家(博客/媒体)李开复在零一万物万策AI媒体发布会上指出,过去两年AI编程能力已超过人类,许多公司90%以上代码由AI生成。AI编程突破使其具备改写软件、重构流程和创造系统的能力。他认为程序员无需担忧,因为AI能成为调动系统、执行任务、参与决策的工具。当AI做事能力超越大部分人类时,关键不是取代而是帮人干活,且干活没有上限。行业李开复零一万物AI编程推荐理由:李开复说AI写代码已经超过人类,但程序员别慌,AI是帮你干活不是替代你,还能参与决策。原文稍后读已读值得跟进有用关注 李开复