9月3日
12:16
12:16官方账号arXiv cs.AI@Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo, Jun Wang
精选73°
该研究提出双层协调反射模型,将协调者与工作者的交互建模为双层协调博弈。研究分析了文本反思作为语义记忆状态上的随机运动,推导了有限时间上界,并证明了在特定条件下的下界。研究还引入了随机反思记忆上升(SRMA)算法,在500个SWE-bench实例上达到72.2%的解决率。
推荐理由:清华团队提出多智能体LLM系统的博弈论框架,新算法在SWE-bench上超越基准2.2个百分点。
9月2日
10:11
10:11官方账号arXiv cs.LG@Tomáš Holeček, Viliam Lisý
精选73°
NashDreamer是一种基于模型的强化学习框架,专为双人零和博弈设计。该框架引入了多智能体循环状态空间模型(MARSSM),在四个基准游戏中显著提升了早期训练的样本效率。研究还分析了Dreamer算法族在随机环境中面临的后验崩溃问题。
推荐理由:斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。
00:34
9月1日
14:42
14:42IT之家博客/媒体
73°
Meta宣布旗下AI编程工具Muse Code正式结束Beta测试,新增会话间消息传递、工作流和命令行界面回退功能。Muse Code现可处理复杂多会话、多智能体工程任务,支持macOS和Linux系统安装。Meta同时推出三种订阅套餐,基础版每月5美元,高级版15美元,专业版50美元。
事件专题

推荐理由:Meta的Muse Code正式版上线了,新增了会话互通和工作流功能,还推出了三种不同价位的订阅套餐,适合不同需求的开发者。
09:11
09:11官方账号arXiv cs.AI@Sagar Srinivas Sakhinana, Venkataramana Runkana
精选73°
框架通过图协调器协调专业智能体,包括仓库生成、审查、执行、验证、发布和监控智能体。验证失败会激活有界反思、修复和重新验证,而运行时证据可触发有界适应、恢复或回滚。
推荐理由:Google Cloud上新框架,用多智能体把自然语言MLOps任务变成可验证的云部署,比传统方法更可靠。
8月29日
02:51
02:51官方账号Decoder@Matthias Bastian
78°
Google DeepMind将Co-Scientist从假设生成器扩展为集成到实验室的研究系统。基于Gemini的多智能体系统在材料合成等三个学科领域取得了实验验证的结果。该系统能够自主开发医疗AI架构,并输出可验证的实验数据。

推荐理由:Google DeepMind的Co-Scientist从假设生成器升级为研究伙伴,能自主开发医疗AI架构并验证实验结果。
8月28日
21:08
21:08Harrison Chase@hwchase17
Benchling计划创建专门针对科学领域的AI智能体。该公司相信多智能体世界,每个智能体专注于特定领域。Benchling与Anthropic/OpenAI在科学AI智能体开发上有所不同。Nicholas Larus-Stone支持这一观点。
事件专题

推荐理由:Benchling要搞科学专用AI智能体,和Anthropic/OpenAI思路不同,专注垂直领域。
17:53
17:53官方账号arXiv cs.AI@Jingyi Zheng, Yule Liu, Zifan Peng, Tianyi Hu, Yuemeng Zhao, Xinhu Zheng, Xinlei He
精选73°
TransMeme是一个专门处理跨文化模因再创作的多智能体框架。该框架通过文化适应、目标文本重写、修订和条件视觉调整三个核心挑战。在双向中英文模因再创作任务中,该方法在人工评估和LLM评估中均超越所有基线模型,平均提升33.1%,Top-1排名率达60%。
推荐理由:TransMeme框架解决了跨文化模因再创作的三大挑战,在中文-英文双向转换任务中表现优异。
8月27日
04:53
04:53AK@_akhaliq
Hugging Face 发布论文《开放世界多智能体环境中的自主数学发现》,探讨在开放世界中多智能体如何进行数学发现。论文链接:huggingface.co/papers/2608.23…

推荐理由:想了解多智能体如何进行数学发现的读者,这篇论文值得一读。它展示了在开放世界中,多智能体如何通过协作和自主学习实现数学发现,与传统的数学发现方法有所不同。
8月21日
10:10
10:10官方账号arXiv cs.LG@Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry
RGA-Designer 是一种新的图生成模型,用于设计多智能体系统的通信拓扑。该模型通过引入奖励模型来指导生成过程,奖励模型同时考虑任务正确性和结构紧凑性。在保持与 ARG-Designer 相同任务准确率的同时,RGA-Designer 将平均令牌消耗降低了 20.5%。
推荐理由:OpenAI 推出的 RGA-Designer,能让多智能体系统在保持性能的同时,减少 20.5% 的 token 消耗,比之前的 ARG-Designer 更高效。
00:39
00:39官方一手AWS Machine Learning Blog@Kristine Pearce
精选
AWS 发布了关于企业级智能体扩展模式的系列文章第二篇。文章探讨了机器学习团队如何在多框架、多模型、多供应商的复杂环境中运营多个智能体系统。核心是介绍让这些系统协同扩展的原则,同时保持灵活性并避免供应商锁定。
推荐理由:AWS 讲了企业如何搭建不绑定特定厂商的智能体系统。他们分享了在复杂环境中让多个智能体协同工作的原则,对想构建自己智能体生态的团队很有参考价值。
8月18日
01:13
8月17日
8月14日
11:59
11:59官方账号arXiv cs.AI@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S Cook
MARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。
推荐理由:宾大开源了临床AI框架MARC,用多智能体分工替代大提示词,Decomposer自动生成提示,改配置就行,不用写代码。
8月13日
8月10日
11:19
11:19官方账号arXiv cs.AI@Bella Xinrui Li, Frank Yingjie Huo, Neil F Johnson
arXiv论文2608.07457用两个AI做了交互实验。两个AI共享相同的解码温度,但subordinate却进入独自运行时不存在的异类状态。当boss倾听回复时,两个AI会进入相似的异类动态,论文用一个动力学理论解释了该现象。
推荐理由:这篇arXiv论文发现,两个AI互相聊天时会出现单个AI没有的怪行为,比如一个AI一直发指令不理对方,另一个就会陷入陌生状态。用物理的视角看AI,挺有意思。
8月8日
10:58
10:58Latent.Space@latentspacepod
一条推文将Zawinski定律延伸到多智能体系统:每个智能体都会持续扩展自己的能力,直到能与其他智能体通信。无法实现通信扩展的智能体,最终会被能够通信的智能体取代。该观点出自latent.space的AI新闻栏目,指向一篇相关文章。
推荐理由:这条推文把老定律翻新成多智能体版:每个智能体都得学会跟同类通信,否则就被取代。观点来自latent.space。
09:29
09:29官方账号Latent Space (swyx)博客/媒体
文章以扎温斯基定律(软件会不断扩展直到能读邮件)为分析框架。作者借此串联近期AI新闻中与多智能体相关的线索。全文围绕多智能体协作与通信机制展开讨论。

推荐理由:这篇把扎温斯基定律套到多智能体上,聊近期AI新闻里那些有关联的事,角度挺有意思。
8月7日
12:43
12:36
12:36官方账号arXiv cs.LG@Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo
电子病历特征工程占数据科学家39%-45%工作量,心衰领域尤其棘手。研究者提出Nimblemind多智能体系统(nMAS),在500份模拟患者记录、9张EHR源表上生成132个结构化特征和70个评分聚合特征。加入聚合特征后,HFrEF分型的held-out AUROC从0.895升至0.963,HFpEF从0.870升至0.910。独立LLM对证据支撑与方法学评分为最高分的81.5%。
推荐理由:心衰数据特征工程又慢又容易出错,nMAS自动管线把HFrEF的AUROC拉到0.963,还能审计特征来源。
8月6日
8月5日
11:05
11:05官方账号arXiv cs.AI@Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi
一项研究测试了临床多智能体委员会是否会被捷径欺骗,覆盖文本、影像和ICU表格七组队列。在MedQA-USMLE等六个数据集上,Gemini委员会单独面对误导线索时仅有5-16%的翻转率,但两个同伴给出同一错误答案时,holdout模型在38%案例中采纳。三种监督智能体中,gate的假阳性率达100%,同源judge在文本上精确率100%但在影像上失效,而独立referee在影像上取得77-88%精确率。研究还发现,视觉显著性提高三倍不增加传染,但第二个同伴声音使传染率提高一半。
推荐理由:Gemini多智能体会被同伴错误带偏(38%案例),独立裁判能抓,门控不行,做临床AI的注意了。