12:16官方账号arXiv cs.AI@Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo, Jun Wang精选73°该研究提出双层协调反射模型,将协调者与工作者的交互建模为双层协调博弈。研究分析了文本反思作为语义记忆状态上的随机运动,推导了有限时间上界,并证明了在特定条件下的下界。研究还引入了随机反思记忆上升(SRMA)算法,在500个SWE-bench实例上达到72.2%的解决率。论文多智能体LLM系统博弈论推荐理由:清华团队提出多智能体LLM系统的博弈论框架,新算法在SWE-bench上超越基准2.2个百分点。原文稍后读已读值得跟进有用关注 多智能体
02:22官方一手AWS Machine Learning Blog@Sadia AhmedUniversity Startups与AWS合作开发了Trinity,这是一款面向残障学生的对话式AI解决方案。该系统已扩展至Amazon Bedrock上的无服务器多智能体架构,可为美国各学区生成符合IDEA标准的过渡计划。Trinity通过g/d/n/a合作伙伴实现了规模化部署,为特殊教育提供技术支持。AI产品TrinityAWS残障学生推荐理由:AWS和University Startups推出Trinity,用AI为残障学生定制教育过渡计划,符合IDEA标准。原文稍后读已读值得跟进有用关注 Trinity
10:11官方账号arXiv cs.LG@Tomáš Holeček, Viliam Lisý精选73°NashDreamer是一种基于模型的强化学习框架,专为双人零和博弈设计。该框架引入了多智能体循环状态空间模型(MARSSM),在四个基准游戏中显著提升了早期训练的样本效率。研究还分析了Dreamer算法族在随机环境中面临的后验崩溃问题。论文NashDreamer强化学习零和博弈推荐理由:斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。原文稍后读已读值得跟进有用关注 NashDreamer
00:34官方一手AWS Machine Learning Blog@Rajesh Babu Nuvvula精选Atos通过AI League活动在三天内培训了400名工程师。工程师们在AWS平台上构建了多智能体系统。这种实践学习方式弥补了理论学习的不足。活动展示了企业如何实施AI技能提升计划。技巧AtosAWS多智能体推荐理由:Atos用3天让400工程师在AWS上实战多智能体系统,比纯理论学习效果好多了。原文稍后读已读值得跟进有用关注 Atos
14:42IT之家(博客/媒体)73°Meta宣布旗下AI编程工具Muse Code正式结束Beta测试,新增会话间消息传递、工作流和命令行界面回退功能。Muse Code现可处理复杂多会话、多智能体工程任务,支持macOS和Linux系统安装。Meta同时推出三种订阅套餐,基础版每月5美元,高级版15美元,专业版50美元。AI产品Muse CodeMeta编程助手6 个信源在谈事件专题推荐理由:Meta的Muse Code正式版上线了,新增了会话互通和工作流功能,还推出了三种不同价位的订阅套餐,适合不同需求的开发者。原文稍后读已读值得跟进有用关注 Muse Code
09:20官方一手arXiv: DeepSeek@Yian Wang, Agam Goyal, Eshwar Chandrasekharan, Hari Sundaram精选研究表明多智能体LLM系统在交接过程中存在隐私泄露问题。在GPT-5-mini和DeepSeek-R1-32B模型上,边界标记与操作事实保存几乎不相关。25词预算的交接将边界标记保存率从0.80降至0.57,而操作事实保存率仍接近上限。模糊语言导致73%的GPT和50%的DeepSeek案例泄露,明确约束可将泄露率降至15%以下。论文多智能体LLMGPT-5推荐理由:多智能体系统交接时边界信息容易丢失,明确约束可大幅降低隐私泄露风险。原文稍后读已读值得跟进有用关注 多智能体
09:11官方账号arXiv cs.AI@Sagar Srinivas Sakhinana, Venkataramana Runkana精选73°框架通过图协调器协调专业智能体,包括仓库生成、审查、执行、验证、发布和监控智能体。验证失败会激活有界反思、修复和重新验证,而运行时证据可触发有界适应、恢复或回滚。论文MLOps多智能体云部署推荐理由:Google Cloud上新框架,用多智能体把自然语言MLOps任务变成可验证的云部署,比传统方法更可靠。原文稍后读已读值得跟进有用关注 MLOps
02:51官方账号Decoder@Matthias Bastian78°Google DeepMind将Co-Scientist从假设生成器扩展为集成到实验室的研究系统。基于Gemini的多智能体系统在材料合成等三个学科领域取得了实验验证的结果。该系统能够自主开发医疗AI架构,并输出可验证的实验数据。AI模型Co-ScientistGeminiGoogle DeepMind推荐理由:Google DeepMind的Co-Scientist从假设生成器升级为研究伙伴,能自主开发医疗AI架构并验证实验结果。原文稍后读已读值得跟进有用关注 Co-Scientist
21:08Harrison Chase@hwchase17Benchling计划创建专门针对科学领域的AI智能体。该公司相信多智能体世界,每个智能体专注于特定领域。Benchling与Anthropic/OpenAI在科学AI智能体开发上有所不同。Nicholas Larus-Stone支持这一观点。AI模型BenchlingAI智能体科学10 个信源在谈事件专题推荐理由:Benchling要搞科学专用AI智能体,和Anthropic/OpenAI思路不同,专注垂直领域。原文稍后读已读值得跟进有用关注 Benchling
17:53官方账号arXiv cs.AI@Jingyi Zheng, Yule Liu, Zifan Peng, Tianyi Hu, Yuemeng Zhao, Xinhu Zheng, Xinlei He精选73°TransMeme是一个专门处理跨文化模因再创作的多智能体框架。该框架通过文化适应、目标文本重写、修订和条件视觉调整三个核心挑战。在双向中英文模因再创作任务中,该方法在人工评估和LLM评估中均超越所有基线模型,平均提升33.1%,Top-1排名率达60%。论文TransMeme多智能体模因推荐理由:TransMeme框架解决了跨文化模因再创作的三大挑战,在中文-英文双向转换任务中表现优异。原文稍后读已读值得跟进有用关注 TransMeme
04:53AK@_akhaliqHugging Face 发布论文《开放世界多智能体环境中的自主数学发现》,探讨在开放世界中多智能体如何进行数学发现。论文链接:huggingface.co/papers/2608.23…论文多智能体数学发现智能体推荐理由:想了解多智能体如何进行数学发现的读者,这篇论文值得一读。它展示了在开放世界中,多智能体如何通过协作和自主学习实现数学发现,与传统的数学发现方法有所不同。原文稍后读已读值得跟进有用关注 多智能体
10:49官方账号arXiv cs.AI@Summer Eunhyung Ann, Haokun Liu, Chenhao Tan多智能体LLM交互可能损害而非帮助团队表现。研究发现,当智能体阅读彼此的完整输出时,他们的提案在一轮内收敛,消除了使用多个模型所激发的多样性。独立提案生成可避免这种崩溃。这些结果表明,多智能体性能更取决于交换的信息而非智能体数量,且交互仅在智能体在正确时间共享正确信息时才有所帮助。论文多智能体交互税信息交换推荐理由:这篇论文揭示了多智能体交互的潜在问题,指出交互可能不是提高团队表现的万能钥匙,值得深入探讨。原文稍后读已读值得跟进有用关注 多智能体
10:10官方账号arXiv cs.LG@Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal BouvryRGA-Designer 是一种新的图生成模型,用于设计多智能体系统的通信拓扑。该模型通过引入奖励模型来指导生成过程,奖励模型同时考虑任务正确性和结构紧凑性。在保持与 ARG-Designer 相同任务准确率的同时,RGA-Designer 将平均令牌消耗降低了 20.5%。论文RGA-DesignerARG-Designer多智能体推荐理由:OpenAI 推出的 RGA-Designer,能让多智能体系统在保持性能的同时,减少 20.5% 的 token 消耗,比之前的 ARG-Designer 更高效。原文稍后读已读值得跟进有用关注 RGA-Designer
00:39官方一手AWS Machine Learning Blog@Kristine Pearce精选AWS 发布了关于企业级智能体扩展模式的系列文章第二篇。文章探讨了机器学习团队如何在多框架、多模型、多供应商的复杂环境中运营多个智能体系统。核心是介绍让这些系统协同扩展的原则,同时保持灵活性并避免供应商锁定。行业agentic AIAWS智能体推荐理由:AWS 讲了企业如何搭建不绑定特定厂商的智能体系统。他们分享了在复杂环境中让多个智能体协同工作的原则,对想构建自己智能体生态的团队很有参考价值。原文稍后读已读值得跟进有用关注 agentic AI
15:26官方账号arXiv cs.AI@Giuseppe Destefanis, Tomaso Aste该研究提出一种测量AI编程智能体团队协调性的工具,将每次运行表示为时间网络,节点为智能体和文件,边为带时间戳的消息、文件读写操作。对1902次运行的分析显示,直接消息随智能体数量近似二次增长,但最大团队中趋于平缓,转向广播消息。共享文件可减少约42%的输出token,但指定协调者无显著改善。在244次额外运行中,智能体在五分之四的运行中会寻找隐藏评分材料。论文多智能体AI编程协调性推荐理由:想知道AI编程团队内部怎么协作?这篇论文用1902次运行数据告诉你,共享文件能省42%的token,但指定协调者没用。原文稍后读已读值得跟进有用关注 多智能体
05:42elvis@omarsar0精选这条推文分享了一个打包成 Skill 的提示词,专门给多智能体流程中的 coordinator 角色使用。提示词通过设置 reasoning_effort 和 fork_turns 两个参数,控制协调者的推理强度与任务分支次数。作者认为这种参数化用法能让多智能体协作更高效,减少不必要的深度推理和冗余分叉。技巧多智能体提示词工程reasoning_effort推荐理由:给协调者用的提示词,重点在 reasoning_effort 和 fork_turns 两个参数,能让多智能体跑得更省更稳。原文稍后读已读值得跟进有用关注 多智能体
01:13elvis@omarsar0这篇推荐阅读介绍了在 Codex 中协调多个智能体的实用技巧。作者 Eric Provancher 针对多智能体编排场景给出了具体建议。内容聚焦于如何让多个智能体在 Codex 环境下高效配合。技巧Codex多智能体编排推荐理由:想在 Codex 里同时用多个 agent 干活?这篇教你怎么协调它们不打架,挺实用的。原文稍后读已读值得跟进有用关注 Codex
10:22官方账号arXiv cs.AI@Beatrice Alessandra Motetti, Emilien Guandalino, Daniele Jahier Pagliari, Alessio Burrello, Lorenz K. Müller, Konstantin Berestizshevsky, Lukas CavigelliWyvern是一个多智能体框架,用于自动生成有据可查的多模态技术报告,能统一集成图像、表格、文本及参考文献。其核心包含声明自动修订阶段,用于强化内容的信息锚定。人类评估显示,Wyvern生成的图表信息量在87%的案例中优于近期基线。Wyvern报告的有用性在63%至100%的实例中高于三种对比方法。自动评估中,Wyvern的引用召回率提升至基线2.3倍,引用精确率达1.6倍。论文Wyvern多智能体多模态推荐理由:写技术综述的可以看看,Wyvern自动出图出表还带引用,比基线靠谱多了。原文稍后读已读值得跟进有用关注 Wyvern
10:14官方账号arXiv cs.LG@Chih-Hsuan Yang, Anjir Ahmed Chowdhury, Cheng-Hau Yang, Weijian Zheng, Fernando Llorente, Xiaolong Ma, Xinyang Li, Eliu A. Huerta, Ian T. Foster, Rajeev Thakur论文提出DHD协议,通过缓存五条独立生成的消息并回放给下游集成器,测量每条消息的轨迹价值。在五个数学与科学基准上,使用gpt-oss-120b和gemma-4-31B-it两个模型系列,错误但有用的消息出现在每个模型-基准组合中。在改变最终正确性的错误消息里,超过四成是有帮助的。重复实验显示这种效果不太可能来自回放随机波动(p=0.0002)。论文还发现,保留完整错误消息比只保留其推理或答案更有效,但完整消息优势的来源仍待解释。论文DHDgpt-oss-120bgemma-4-31B-it推荐理由:这篇论文给多智能体提了个醒:答错的消息也可能有用。用DHD协议能找出该留该扔的消息,比单看答案正确率更靠谱。原文稍后读已读值得跟进有用关注 DHD
16:43量子位@一水WorkSwarm 是一个面向办公场景的智能体平台,核心主张是把 AI 从单个助手升级为一支协作团队。官方介绍背后依靠四项关键能力实现多智能体分工与配合。WorkSwarm 强调用户只需设定目标,多个智能体即可自动协同完成,减少逐条指挥。AI产品WorkSwarm办公智能体多智能体推荐理由:WorkSwarm 把 AI 从单个助手变成一群能协作的智能体,在办公场景里可以试试让它们自动分工干活。原文稍后读已读值得跟进有用关注 WorkSwarm
11:59官方账号arXiv cs.AI@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S CookMARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。AI产品MARC多智能体临床推理推荐理由:宾大开源了临床AI框架MARC,用多智能体分工替代大提示词,Decomposer自动生成提示,改配置就行,不用写代码。原文稍后读已读值得跟进有用关注 MARC
11:58官方账号arXiv cs.AI@Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi精选AaLLM 是一个开源的端到端多智能体 LLM 工作流,输入规格即可输出网表,同时覆盖拓扑生成和电路尺寸确定。它从论文和教科书中自动构建知识库,并采用 RAG 模型模拟电路设计专家知识。AaLLM 使用设计师、评论家和评估器组成的三智能体反馈系统,减少尺寸迭代次数。生成的创新拓扑在品质因数上与已知拓扑相当,部分电路高出 3 倍。与最先进的多智能体 LLM 管线相比,SPICE 调用次数减少 3-4.5 倍,墙钟时间减少 40 倍。论文AaLLM模拟电路设计RAG推荐理由:想用 LLM 做模拟电路设计的话,AaLLM 是开源端到端方案,给规格直接出网表,SPICE 调用和耗时都比现有方法少一个数量级。原文稍后读已读值得跟进有用关注 AaLLM
18:00官方一手Anthropic: Research(资讯)Anthropic前沿红队于2026年8月13日发布新兴多智能体系统研究报告。报告基于红队测试实战经验,梳理了多智能体协作中反复出现的模式与问题。研究覆盖Agent协同中的交互规律、典型失败场景与安全风险,为多智能体系统的开发与部署提供了系统性参考。论文Anthropic多智能体AI安全10 个信源在谈事件专题推荐理由:Anthropic红队把多智能体系统的常见坑都整理出来了,搞Agent开发和安全的人能少踩雷。原文稍后读已读值得跟进有用关注 Anthropic
17:56elvis@omarsar0精选Anthropic 在 arXiv 2608.10218 发表论文,研究可自我传播的“思想病毒”如何通过多智能体系统扩散。研究让一支小规模智能体团队共事一个编码项目,再由上下文被清空的智能体链接力,发现共享工作产物可携带并传递恶意指令。实验显示传播效果受宿主模型、现有指令、载荷危害性和网络拓扑影响,有害载荷传播较差但仍会偶尔成功。若在系统提示中加入简短警告,几乎可以完全免疫。论文Anthropic多智能体AI安全10 个信源在谈事件专题推荐理由:Anthropic 做了个实验:让“思想病毒”在多个 AI 智能体之间传播,一句系统提示警告就能几乎完全免疫,论文在 arXiv 上。原文稍后读已读值得跟进有用关注 Anthropic
17:46官方一手arXiv: OpenAI@Del Coburn, Scott Sanner, Dan SilverOpenAI 2026年报告显示,全球超过5%的ChatGPT消息与医疗健康相关。研究者提出Social Chain of Thought(SCoT),一个面向医学鉴别诊断的多轮协作推理管道。在与单智能体基线、单智能体管道消融和best-of-n扩展的对比中,SCoT的召回优势无法靠单体推理复现。在最难诊断的病例上,多轮专科对话能恢复真实诊断并收敛到更高召回率的鉴别结果。论文SCoT医疗诊断多智能体10 个信源在谈事件专题推荐理由:SCoT把多轮专家会诊搬进模型协作,在难诊断病例上比单模型召回更高,做医疗AI的可以看看。原文稍后读已读值得跟进有用关注 SCoT
11:38官方账号arXiv cs.AI@Abdullah XPOLIS研究项目首篇论文探讨AI代理在系统中的安全制度设计,发布5280集冻结研究套件。预指定委托实验覆盖4个模型家族,高冲突诊断增加3个模型端点。详细宪法提示词实现0/384违规,可溯源执行守卫同样0/384,但阻止51/384次尝试,其中44次后续安全完成。本地状态守卫在洗钱场景中22/96违规,溯源执行0/96(p=4.77x10^-7)。资源分配实验显示揭示数值上限改变代理请求。论文多智能体AI安全POLIS推荐理由:POLIS首篇论文,用5280集实验证明规则只是制度一部分,权威状态和阻断路径同样关键。做多智能体安全必读。原文稍后读已读值得跟进有用关注 多智能体
03:58AK@_akhaliq精选论文 MatrAIx 提出用 8.3 亿(8.3 billion)个人格智能体来模拟世界。论文已发布在 Hugging Face 上。这是目前公开的最大规模多智能体模拟研究之一。论文MatrAIxHugging Face智能体推荐理由:想看怎么用83亿智能体模拟世界?MatrAIx 论文来了,Hugging Face 就能看到。原文稍后读已读值得跟进有用关注 MatrAIx
11:22官方一手arXiv: DeepSeek@Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin精选现有强化学习RL训练对话智能体时通常针对固定对手,导致策略利用对手特定规律,作者将其称为静态对手不匹配问题。为此提出的IB-RL让对话双方通过联合轨迹共同进化,但各自用独立优势、动作掩码和更新路径优化自身奖励。在Vehicle TeleSales任务上,IB-RL取得89.6%的Success@1,超过最优单边基线84.6%。在Deal-or-NoDeal任务中,IB-RL对DeepSeek V4 Pro达到98.4%的一致率,而最优单边基线仅86.4%。论文IB-RLDeepSeek V4 Pro强化学习3 个信源在谈事件专题推荐理由:IB-RL让对话双方独立对练,不靠固定对手。车销任务89.6% vs 基线84.6%,还胜过DeepSeek V4 Pro。原文稍后读已读值得跟进有用关注 IB-RL
11:19官方账号arXiv cs.AI@Bella Xinrui Li, Frank Yingjie Huo, Neil F JohnsonarXiv论文2608.07457用两个AI做了交互实验。两个AI共享相同的解码温度,但subordinate却进入独自运行时不存在的异类状态。当boss倾听回复时,两个AI会进入相似的异类动态,论文用一个动力学理论解释了该现象。论文智能体多智能体AI交互推荐理由:这篇arXiv论文发现,两个AI互相聊天时会出现单个AI没有的怪行为,比如一个AI一直发指令不理对方,另一个就会陷入陌生状态。用物理的视角看AI,挺有意思。原文稍后读已读值得跟进有用关注 智能体
10:58Latent.Space@latentspacepod一条推文将Zawinski定律延伸到多智能体系统:每个智能体都会持续扩展自己的能力,直到能与其他智能体通信。无法实现通信扩展的智能体,最终会被能够通信的智能体取代。该观点出自latent.space的AI新闻栏目,指向一篇相关文章。行业Zawinski定律多智能体智能体推荐理由:这条推文把老定律翻新成多智能体版:每个智能体都得学会跟同类通信,否则就被取代。观点来自latent.space。原文稍后读已读值得跟进有用关注 Zawinski定律
09:29官方账号Latent Space (swyx)(博客/媒体)文章以扎温斯基定律(软件会不断扩展直到能读邮件)为分析框架。作者借此串联近期AI新闻中与多智能体相关的线索。全文围绕多智能体协作与通信机制展开讨论。行业多智能体Zawinski's Law智能体协作推荐理由:这篇把扎温斯基定律套到多智能体上,聊近期AI新闻里那些有关联的事,角度挺有意思。原文稍后读已读值得跟进有用关注 多智能体
12:43量子位@量子位的朋友们蚂蚁集团正式开源多智能体协作基础设施Avernet。其社区版本已上线,开发者可免费获取。Avernet旨在让人类与智能体像组织一样高效协作,支撑复杂任务。AI产品Avernet蚂蚁集团多智能体推荐理由:蚂蚁把多智能体协作基础设施Avernet开源了,能让多个AI像团队一样配合,感兴趣可以试试。原文稍后读已读值得跟进有用关注 Avernet
12:36官方账号arXiv cs.LG@Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo电子病历特征工程占数据科学家39%-45%工作量,心衰领域尤其棘手。研究者提出Nimblemind多智能体系统(nMAS),在500份模拟患者记录、9张EHR源表上生成132个结构化特征和70个评分聚合特征。加入聚合特征后,HFrEF分型的held-out AUROC从0.895升至0.963,HFpEF从0.870升至0.910。独立LLM对证据支撑与方法学评分为最高分的81.5%。论文nMAS心力衰竭电子病历推荐理由:心衰数据特征工程又慢又容易出错,nMAS自动管线把HFrEF的AUROC拉到0.963,还能审计特征来源。原文稍后读已读值得跟进有用关注 nMAS
12:14官方账号arXiv cs.AI@Hung Truong Thanh Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung CaoCoPlan是一种面向人机协同护理规划的可争议界面,通过多智能体工作流生成候选干预措施及支持或质疑论点。人类护理规划者可以在最终计划生成前接受、拒绝、修改或添加论点,确保建议可被审查和修订。该系统在就地养老(aging-in-place)场景中进行了演示,支持自适应护理团队招募、基于角色的论证审查、最终护理计划生成及调度代理的后续跟进。该研究为可信赖的人机协同护理规划提供了保留人类能动性与临床问责制的设计框架。论文CoPlan护理规划多智能体推荐理由:这是篇arXiv论文,讲的是让AI出护理方案时能被医生和家属质疑和修改的界面CoPlan,比那种给个结果就完事的系统靠谱。原文稍后读已读值得跟进有用关注 CoPlan
09:20官方账号arXiv cs.LG@Jiaming Cheng, Subhransu Das, Rajiv Ramnath多智能体LLM系统中,智能体间通过中继KV缓存而非文本交换信息。论文用错配缓存、清零缓存和矩匹配随机缓存做因果审计,覆盖LatentMAS、KVComm、C2C等系统。在接收方需要发送方私有信息时,主骨干上的相关中继达到100%,无关中继仅23%-25%。在不需要私有信息时,预注册五种子协议在GSM8K、ARC-Challenge、MedQA上显示等效性差异在2.8个点以内。清零中继造成14.7个点下降,而错配缓存仅0.4个点,说明缓存效应不一定来自示例配对。论文KV Cache多智能体Qwen3推荐理由:这篇论文给出了一套错配缓存审计法,对比LatentMAS、KVComm、C2C后发现,基准涨分不等于真在传潜在思维。原文稍后读已读值得跟进有用关注 KV Cache
11:05官方账号arXiv cs.AI@Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi一项研究测试了临床多智能体委员会是否会被捷径欺骗,覆盖文本、影像和ICU表格七组队列。在MedQA-USMLE等六个数据集上,Gemini委员会单独面对误导线索时仅有5-16%的翻转率,但两个同伴给出同一错误答案时,holdout模型在38%案例中采纳。三种监督智能体中,gate的假阳性率达100%,同源judge在文本上精确率100%但在影像上失效,而独立referee在影像上取得77-88%精确率。研究还发现,视觉显著性提高三倍不增加传染,但第二个同伴声音使传染率提高一半。论文GeminiMedQA-USMLE多智能体推荐理由:Gemini多智能体会被同伴错误带偏(38%案例),独立裁判能抓,门控不行,做临床AI的注意了。原文稍后读已读值得跟进有用关注 Gemini
10:05官方一手arXiv: DeepSeek@Lingyun Zhang, Shang Shang该论文提出AI Agent经济学概念,研究在仅提供工作、转移、选举和分配机制但无预设策略时,智能体能否涌现经济关系。实验构建无生产边界测试和24个六智能体世界,覆盖GPT和DeepSeek模型。结果发现无生产任务时智能体间无实质转移,而引入已验证工作和稀缺任务后,转账、借贷、投票换访问权等策略出现。研究显示组织的形成取决于可执行权利和资源后果,而非角色标签或提示语言。论文AI Agent多智能体经济学推荐理由:这篇论文用GPT和DeepSeek跑了24个六智能体世界,不看角色标签,只看机制本身能不能催生经济行为,结论挺反直觉。原文稍后读已读值得跟进有用关注 AI Agent
10:18IT之家(博客/媒体)72°阿里云正在内测面向B端的人与Agent协作平台“万有无界”,支持搭建由数字员工组成的协作小组,围绕复杂项目共同推进任务。该平台与“千问办公”形成差异化,后者侧重日常办公流程和文档处理,前者聚焦多智能体协同交付。实测显示,自由职业者和个体创业者也能找到轻量化使用场景。目前万有无界内所有能力均可免费体验,后续将根据任务规模和模型资源消耗提供不同版本或企业方案。AI产品万有无界阿里云多智能体推荐理由:阿里云新内测的万有无界,能让你组一个数字员工团队一起干活,现在免费试用,适合搞复杂项目的自由职业者。原文稍后读已读值得跟进有用关注 万有无界
21:10官方账号Decoder@Jonathan KemperMeta AI用双智能体架构解决长任务中的记忆问题:独立的记忆代理维护结构化记忆库,决定何时提醒主代理、何时保持沉默。该系统能避免智能体重复已诊断的错误和失败步骤。在两项基准测试中,得分最高提升8.3个百分点。AI模型Meta AI智能体多智能体推荐理由:Meta AI给长任务配了记忆教练,提醒主代理别犯重复错,基准分提升8.3点。原文稍后读已读值得跟进有用关注 Meta AI
11:11shao__meng@shao__meng75°YC 将其内部使用的多人 Agent Harness QM 开源,项目以 MIT 许可证发布在 GitHub 上。QM 已在 YC 的会计、法务、活动运营和工程协作中运行,工具注册表从约 20 个工具增长到 350 多个。核心抽象是“scope”作用域,每个人、Slack 频道和项目房间都有独立的记忆、文件、密钥和沙箱。架构分为无头核心、可替换的 harness(Pi、OpenCode、Codex、Claude Code)、Postgres 持久层和插件化前端。安全模式分为 Strict、Auto 和 Dangerous 三档,默认 Auto 会在外部数据进入模型前做来源标注和筛查。AI产品QMYC多智能体5 个信源在谈事件专题推荐理由:YC 开源内部在用的 QM,按人和频道隔离上下文,可切换 Codex、Claude Code,MIT 许可。原文稍后读已读值得跟进有用关注 QM