9月3日
9月2日
23:33
23:33IT之家博客/媒体
精选73°
谷歌在 Google DeepMind 网站上线了 Gemini 3.8 Flash 模型,基于 Gemini 3.7 Flash 开发。该模型拥有最高 1M token 上下文窗口和 64K token 文本输出能力。在编程、知识处理、多模态处理等基准测试中表现优异。模型面向个人用户、开发者和企业,适合软件工程和智能体任务场景。
事件专题

推荐理由:谷歌新发布的 Gemini 3.8 Flash 模型,在软件工程和智能体任务方面有提升,支持自定义努力水平,适合大规模部署。
09:33
09:33官方一手arXiv: DeepSeek@Mustafa Yasir Altunhan, Hüseyin Özgür Kamalı, Eray Tüzün
精选73°
研究通过微调GPT-4o和多个开源模型(CodeLlama-7B、CodeQwen1.5-7B等)来分类PR与问题的对应关系。微调后的模型准确率和F1-micro提升了6.15%,F1-macro提升了14.69%。CodeLlama-7B表现最佳,代码差异与问题内容对预测影响最大。
推荐理由:研究人员微调了多个大模型来自动匹配PR和问题,准确率提升显著,还能解释模型决策依据。
8月31日
11:45
11:45官方账号arXiv cs.AI@Ahmed Hereiz, Yingzhe Lyu, Hao Li, Bram Adams, Ahmed E. Hassan
73°
研究分析了1,926个Claude Code插件仓库,共8,351个插件和77,773次提交。2025年10月发布后6个月内,插件相关提交活动增长8.8倍。61.3%的插件针对软件工程任务,功能提交率(39.6%)是传统开源软件的两倍多。Claude参与了34.9%的提交,78%的技能目录中的指令文件与实现脚本功能耦合。
推荐理由:Claude Code插件市场增长迅猛,功能提交率高,Claude参与度高,存在新型维护依赖关系。
8月29日
02:08
8月28日
18:08
18:08官方账号arXiv cs.AI@Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng
精选73°
SWE-Prime是一种多粒度、两阶段的SFT数据选择方法。该方法在轨迹级别筛选高质量代表性子集,在段落级别评估各段落对解决方案的贡献度和学习价值。实验显示,使用SWE-Prime选择的10%轨迹子集进行训练,在SWE-Bench Pro和SWE-Bench Verified基准上分别获得12.2%和24.2%的相对性能提升。
推荐理由:SWE-Prime用10%数据训练就能超越全数据效果,解决了软件工程领域模型训练数据质量低的问题。
8月24日
15:08
7月30日
11:29
11:29官方账号arXiv cs.LG@Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan
论文提出 MindForge 自动流程,将开源命令行程序转为仅暴露编译后可执行文件和文档的源码无关环境。用 GLM-5.2 作为教师智能体生成高质量程序合成轨迹,微调 Qwen3.6-27B。微调后模型在 ProgramBench 上平均测试通过率从 37.98% 提升至 49.51%,并在 7 个未见基准上均获提升,如在 RepoZero-C2Rust 上绝对增益 31.00 分、SWE-bench Verified 上 5.04 分。
推荐理由:MindForge 教小模型从零写完整软件,不用源码只用可执行文件和文档就把 Qwen3.6-27B 在 ProgramBench 上提升了 11.53%,跟大模型差不多。
7月29日
7月23日
07:01
07:01官方账号Together AI@togethercompute
精选
使用DeepSWE基准对比了Kimi K3 Max和GPT 5.6 Sol Max在软件工程任务上的表现。Kimi K3 Max达到了与GPT 5.6 Sol Max相当的性能,而价格仅为后者的约55%。将两个模型联合使用时,性能可额外提升约16%。
事件专题

推荐理由:Kimi K3 Max性价比炸裂,软件工程能力不输GPT 5.6 Sol Max,混合使用还能再提分,值得关注。
7月22日
12:56
12:56官方账号arXiv cs.AI@Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini
本教程汇总了基于大语言模型(LLM)的智能体系统在软件工程、科学发现和金融等领域的生产级部署经验。内容涵盖推理与规划、多智能体协调和评估等研究进展,以及来自实际部署的挑战。通过制药发现和金融系统的应用案例,分析了成功设计模式和失败缓解策略,包括验证管线、回退机制和人在环路监督。
推荐理由:这篇论文从实际部署出发,总结了LLM智能体在软件、金融等领域的成功模式和失败应对,比只看benchmark的研究更有实战价值。
7月19日
03:21
03:21官方账号LangChain@LangChainAI
精选
LangChain在内部构建了一套完整的软件工程智能体工厂并全部开源。Brace Sproul的博客深入解析了每个组件的功能和设计思路。开源这些组件使开发者能够自由构建和定制自己的软件工程智能体。
推荐理由:LangChain把内部用的全套软件工程智能体工厂开源了,博客逐组件讲解,想自己搭agent的别错过。
7月15日
6月30日
10:37
10:37官方一手arXiv: DeepSeek@Xuan Zhao, Haonan He, Qingyu Yang, Minglei Li, Jingqi Ye, Zelin Tan, Bo Wan, Peng Ye
提出ParametricSkills框架,将自由格式的文本技能在测试时转换为LoRA参数适配器。该框架利用大规模技能库和OpenCode合成的单/多轮轨迹训练超网络。在六个软件工程子任务上,比上下文学习平均提升6.44个点(由DeepSeek-V4-Flash评判),BERT Score和F1分数也更高。参数化技能具有累积性,为测试时持续学习提供了初步方向。
事件专题

推荐理由:这篇论文把技能文本直接转成模型参数,编程任务上比上下文学习高出6分多,还能不断积累,挺实用的。
6月10日
6月8日
6月4日
06:43
06:43Augment Code@augmentcode
76°
Augment Code 宣布推出 Cosmos,这是一个面向软件团队的统一智能体平台。该平台允许团队在整个软件开发生命周期中编排多个智能体,将它们整合为一个单一的组织系统,而非孤立的工人。据官方称,Cosmos 已改变了其自身工程团队的工作方式,吞吐量提升了 3 倍。这标志着 AI 辅助开发从单点工具向系统化协作平台的重要演进。
推荐理由:软件团队终于有了一个能统一管理多个 AI 智能体的平台,解决了智能体碎片化的问题。做工程管理的团队可以直接参考其 3 倍吞吐量提升的实践,建议点开了解如何编排智能体。