9月2日
10:50
10:50官方账号arXiv cs.AI@Kefeng Duan, Dewu Zheng, Yanlin Wang, Terry Yue Zhuo, Mingwei Liu, Jianxing Yu, Jiachi Chen, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng
精选73°
ACToR框架针对仓库级代码生成任务,在生成过程中识别关键令牌并按需触发检索。该方法在RepoExec和CoderEval两个基准测试中分别实现了8.4%和15.4的相对性能提升。研究还量化了关键令牌对生成失败的影响,突显了针对性检索策略的必要性。
推荐理由:DeepSoftwareAnalytics团队推出ACToR框架,能精准定位代码生成中的关键点,比现有方法表现更好。
09:39
8月28日
8月25日
18:48
8月21日
10:34
10:34官方一手arXiv: DeepSeek@Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan
大型语言模型在代码生成方面取得显著进展,但大多数现有系统假设预定义的仓库架构。Repo0是一个针对零到全代码生成的持续结构演化框架,通过GPT-5 mini和DeepSeek V3.2在RepoCraft的六个真实仓库上评估,Repo0在所有设置中实现了最高的功能覆盖率和通过率,与RPG相比,功能覆盖率提高20.08个百分点,通过率提高29.74个百分点。
推荐理由:Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。
8月20日
23:04
8月14日
18:47
18:47官方账号Decoder@Matthias Bastian
72°
智谱AI发布GLM-5.3,并称其为最强的开源权重编码模型。据其自家基准,仅通过后训练就比上一代提升50%。该模型经过网络安全训练,帮助安全团队在269个项目中找到2436个漏洞。模型权重计划在两周后开源。
事件专题

推荐理由:智谱发了GLM-5.3,说是开源编码模型里最强的,后训练提升50%,还帮找出了2436个漏洞,权重两周后开源,可以关注下。
11:29
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song
精选
Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。
推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。
8月8日
8月6日
07:07
07:07官方账号Meta AI@AIatMeta
精选
Meta发布Muse Spark 1.2,相比前代显著扩大编码任务的训练计算规模,并增加训练环境多样性。新模型在代码生成、复杂调试和端到端开发者工作流上均有提升。Muse Spark 1.2与Muse Code联合训练,针对全仓库生成、大型项目和自动研究任务优化。
事件专题

推荐理由:Meta把Muse Spark 1.2的编码能力调强了,配Muse Code一起用,全仓库生成和调试都更顺,写大项目可以试试。
8月4日
06:30
06:30官方账号Yann LeCun@ylecun
精选
Yann LeCun 在 X 平台回应网友评论,澄清他批评的对象是纯 LLM 所采用的自回归 token 预测。他表示,优秀的代码生成系统并不属于纯 LLM,工作方式也不是简单的自回归 token 预测。这条推文获得 133 次点赞、25 条回复,浏览量超过 1.7 万。
推荐理由:LeCun 发推澄清:别把代码生成器和纯 LLM 自回归划等号,观点直接,适合关注大模型技术路线的人。
8月1日
04:50
04:50官方账号Greg Brockman@gdb
GPT-5.6 Luna 今日降价 80%。开发者 Simon Willison 在 Datasette Agent 中实测,称其运行飞快。该模型能生成 SQL、HTML 和 JavaScript 代码。Simon 认为这是一款低成本且性能出色的模型。
事件专题

推荐理由:GPT-5.6 Luna 今天降价 80%,Simon 实测超快,写 SQL、HTML、JS 都行,便宜还强。
7月31日
10:45
10:45AI Will@FinanceYF5
75°
Matt Shumer 发布演示视频,Claude Opus 5 一次生成一个完整游戏。演示中所有画面与逻辑均为模型自定义代码,未使用任何外部素材。该游戏由 Claude Opus 5 单次编码完成,无需人工修改。
推荐理由:Matt Shumer 用 Claude Opus 5 演示了一把生成游戏,画面和逻辑全靠模型自己写,不用任何外部素材,看着挺神奇。
10:29
10:29官方账号Simon Willison@simonw
GPT-5.6 Luna今日降价80%,Simon Willison随即在Datasette Agent中实测。它生成SQL、HTML和JavaScript代码速度快,可用于Datasette Apps。推文获得101次点赞和5103次查看。
事件专题

推荐理由:Simon Willison说降价80%的GPT-5.6 Luna很猛,在Datasette Agent里跑得飞快,SQL、HTML、JS都能生成,开发者可以看看。