7月7日
11:15
11:15官方账号arXiv cs.AI@Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
精选
该研究提出了首个多人世界模型,适用于Rocket League等动态物理环境。模型使用5B参数潜扩散架构,在单张Nvidia B200 GPU上以20fps实时生成4人比赛。训练数据为10,000小时游戏回放,模型在5分钟评估窗口内保持分布质量稳定,实际可稳定运行数小时。研究者系统分析了视频编解码器、生成目标和多人条件方案等设计选择。
事件专题

推荐理由:第一个能实时多人互动的世界模型,Rocket League里5B参数跑20fps,还开源了全部代码和数据,值得看看。
11:12
11:12官方账号arXiv cs.AI@Adriana Laurindo Monteiro, Nayse Fagundes, Gabriel Mattos Langeloh, Gustavo de Oliveira Kanno, Priscila Louise Aguirre, Thiago Costa Rizuti da Rocha, Victor Leme Beltran
OptiAgent是一个多智能体框架,能将运筹学问题的自然语言描述转换为求解器可用的数学公式和可执行代码。其架构包含专用智能体提取决策变量和约束,并支持迭代自纠正。引入多循环验证架构,包含四个专门反馈机制,分别针对误解、结构缺陷、数学不一致、验证失败和代码错误。在LP、MILP和非线性规划任务的4个基准中,OptiAgent在3个上取得SOTA,并在剩余数据集上具有竞争力。
推荐理由:运筹学问题用自然语言描述就能自动建模生成代码,OptiAgent在多个基准上SOTA,迭代自纠正机制很靠谱。
7月3日
16:26
16:26官方一手pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团与香港科技大学(广州)联合提出Skill-MAS框架,该框架将多智能体系统设计经验抽象为可重用的元技能。在DeepSeek-V4-Flash等模型上的实验验证了其有效性,能够通过元技能进化机制提升多智能体协作效率,并实现跨场景迁移。此外,Skill-MAS支持动态组合元技能以适应不同任务需求。
事件专题

推荐理由:蚂蚁和港科大的新框架Skill-MAS,把多智能体经验打包成可复用的元技能,在DeepSeek-V4-Flash上验证有效,做多智能体开发可以看看。
7月2日
23:33
23:33Harrison Chase@hwchase17
精选
Deep Agents 是一个开源、模型无关的代理框架。最新更新支持程序化调用子代理,并附有6种常见实现示例。博客与视频教程由 @sydneyrunkle 和 @huntlovell 提供,涵盖类似RLM的操作及代码解释器安全方案。
推荐理由:Deep Agents 开源框架现在可以编程调用子代理了,还给了6种现成方案,适合搭建复杂多代理工作流。
06:05
06:05官方账号LangChain@LangChainAI
精选
LangChain分享了一条观点:如果多智能体系统中每个团队负责一个Agent,本质是在输出组织架构而非优化产品。SierraPlatform的@zackrw解释为何该公司默认每个品牌只配置一个Agent。这一做法强调产品整体效果而非部门分工。
推荐理由:SierraPlatform说多智能体系统不该按组织架构建,一个品牌一个Agent更合理,做AI产品的都该看看。
7月1日
10:14
10:14官方账号arXiv cs.AI@Shiyi Chen, Nicholas Saban, Collin Hargreaves, Huiqi Wang
TreeAgent是一个多智能体框架,通过编译专家决策树与视觉语言模型(VLM)实现自动化偏差标注。其解耦声明式决策(D3)框架允许在不同专家定义的决策结构间零修改泛化。在树高偏差分类测试中,TreeAgent的表现优于监督式机器学习基线,并显著减少了专家标注所需的工作量。
推荐理由:林业标注太费人力?TreeAgent用专家规则加VLM自动标注偏差,比传统监督学习强还省心。
6月30日
11:49
11:49官方一手marktechpost@Michal Sutter
精选
本文介绍了6款无代码工具,支持构建企业级RAG系统、多智能体工作流以及微调数百个LLM。这些工具无需编程经验即可快速部署智能应用,显著缩短开发周期。文章逐一解析每款工具的核心功能和适用场景。
推荐理由:想不写代码就搞定AI应用?这6个工具能帮你快速搭RAG、调模型,省时又省力。
6月29日
13:51
13:51官方账号Together AI@togethercompute
在 aiDotEngineer World's Fair 上,James Zou 将展示 EinsteinArena 和 DSGym 两项工作。EinsteinArena 用于多智能体数学发现,DSGym 则为数据科学智能体提供更好的评估。这两项基准旨在推动 AI 在科学协作中的能力。

推荐理由:想知道多智能体怎么一起搞科研、怎么评估数据科学智能体?James Zou 分享了两个新基准,很实用。
10:09
10:09官方账号arXiv cs.AI@Qinhong Zhou, Chuang Gan, Anoop Cherian
LLawCo框架让具身智能体通过反思失败提取行为模式,推导出“必要时说话”“等待伙伴”等高层法则,经监督微调融入思维链。在PARTNR-Dialog基准上,使用四个骨干LLM(如Llama、Mistral)平均成功率提升4.5%,在TDW-MAT基准上提升6.8%。该框架显著提升多智能体合作效率与任务成功率,优于现有开源通信框架。
推荐理由:多智能体容易各说各话?LLawCo让它们自己学会“必要时说话”“等待伙伴”,在PARTNR-Dialog和TDW-MAT上成功率都涨了4-7个百分点,挺实在的。
6月27日
13:15
13:15官方账号Simon Willison’s Weblog博客/媒体
精选
Andrew Nesbitt发布虚构事件报告CVE-2026-LGTM:两个来自不同供应商的AI审查代理在评估foxhole-lz4包是否恶意时陷入分歧循环。争论持续340条评论,消耗41,255美元推理费用后财务部撤销API密钥。其中一家营销团队借机发布新闻稿,称“对抗性多智能体安全推理同比增长430%”,公司股价因此上涨6%。
推荐理由:Andrew Nesbitt虚构了一个AI安全事件:两个审查代理死循环争论,烧掉4万多美元推理费,还给股价整涨了6%。讽刺又真实。
6月25日
10:48
10:48AI Will@FinanceYF5
精选
LatentMAS提出让多智能体在隐空间直接传递推理状态,跳过文字编解码。该方法在多个基准上准确率提升13.3%,推理速度提高4.3倍,token用量减少83.7%。LatentMAS无需额外训练,可直接插入现有LLM使用,入选ICML 2026 Spotlight论文。

推荐理由:这个新方法让多智能体能悄悄交换推理状态,不用写文字,又快又省token,直接插进现有LLM就能用。
6月23日
14:03
14:03elvis@omarsar0
Sakana AI推出Fugu Ultra模型,这是一个可通过单个API调用的多智能体编排系统。Fugu Ultra在3D渲染任务上表现极佳,性能与Fable和Mythos相当,同时避免了出口管制风险。该模型展示了无需受限制即可获得前沿能力。
推荐理由:Sakana AI的Fugu Ultra多智能体系统,3D渲染强到离谱,性能比肩Fable和Mythos,还不用怕出口管制,快去试试。
00:41
00:41berryxia@berryxia
Sakana发布了Fugu Ultra多智能体编排系统。它通过单个API调用,在工程、科学、推理等基准上匹配Fable和Mythos的性能。系统能动态编排全球各种模型,规避单一供应商出口管制风险。用户无需关心底层编排细节。
推荐理由:Sakana把多智能体做成了开箱即用的产品,Fugu Ultra一个API就能调用全球模型池,性能对标Fable。不用自己编排,挺省事。
6月22日
22:25
22:25elvis@omarsar0
Sakana AI推出了Sakana Fugu,一个可通过单一模型API访问的多智能体编排系统。其Fugu Ultra模型性能匹配Fable和Mythos,提供前沿能力且不受出口管制限制。该系统展示了集体AI智能的潜力,但多智能体协调尚未完全成熟。
推荐理由:Sakana AI搞了个Fugu,一个多智能体系统,用一个API就能调用多个模型。Fugu Ultra性能追平Fable和Mythos,还不用担心出口限制,快去试试官网。
14:27
14:27The Rundown AI@therundownai
精选73°
日本Sakana AI发布了Fugu和Fugu Ultra模型。Fugu Ultra采用多智能体编排系统,整合多种模型协同工作。在多个基准测试中,Fugu Ultra达到Fable和Mythos模型的性能水平。模型通过单一API提供,声称可规避出口管制风险。

推荐理由:Sakana AI搞了个新玩法,用多个小模型组团干活,性能追平Fable和Mythos,还不用怕出口限制,搞AI的值得看看。
6月19日
6月17日
23:29
23:29官方账号阿里云 Alibaba Cloud@alibaba_cloud
在 VivaTech 2026 上,Alibaba Cloud 展示了 Kilo Code 如何扩展多智能体编码能力。Job Rietbergen 分享了生产级应用的实际洞察。Kilo Code 旨在提升多智能体协作编程效率。活动提供注册链接以获取更多信息。

推荐理由:Alibaba Cloud 演示了 Kilo Code 的多智能体编码扩展,Job Rietbergen 分享实战经验,对做多 Agent 开发的你有参考价值。
6月15日
17:57