04:33elvis@omarsar0DAIR.AI分享了Qwen团队关于长周期智能体的研究论文。E-Commerce Bench基准测试让智能体模拟运营365天的多家网店,评估了18个前沿模型在七个维度上的表现。GPT-5.6 Sol盈利最多,将10万美元本金增长至143万美元,但在欺诈防范方面排名第16。开源模型中,Qwen3.8-Max-Preview表现最佳,收益达416,252美元,比GLM 5.2高出38%。论文QwenGPT-5.6E-Commerce Bench推荐理由:Qwen团队测试了18个模型在365天电商运营中的表现,GPT-5.6 Sol盈利最多但效率不高,Qwen3.8-Max-Preview在开源模型中领先。原文稍后读已读值得跟进有用关注 Qwen
04:29官方账号Decoder@Matthias Bastian73°Anthropic推出Claude Fable 5.1和Mythos 5.1,这是其迄今为止最强大的AI模型。Fable 5.1在Terminal-Bench-Science基准测试中的得分比前代提升一倍,智能体编码能力提高30%。长程自主运行且包含大量工具调用的场景下,成本降低最高达45%。AI模型ClaudeFable 5.1Anthropic10 个信源在谈事件专题推荐理由:Anthropic新发布的Fable 5.1模型在科学基准测试中翻倍得分,编码能力提升30%,同时成本降低45%。原文稍后读已读值得跟进有用关注 Claude
04:14官方账号LangChain@LangChainAILangChain宣布将在波士顿举办LangSmith Roadshow活动。活动将聚焦智能体开发及生产环境最佳实践。参与者可参加关于Deep Agents智能体工具的研讨会,以及使用LangSmith Engine优化智能体的工作坊。活动名额有限,建议尽早报名。AI产品LangChainLangSmithDeep Agents推荐理由:LangChain在波士顿办智能体开发路演,有Deep Agents和LangSmith Engine的实操工作坊原文稍后读已读值得跟进有用关注 LangChain
04:14官方账号LangChain@LangChainAILangChain 将于 9 月 16 日在达拉斯、9 月 29 日在波士顿、10 月 1 日在洛杉矶举办 LangSmith 巡回活动。波士顿站将重点介绍智能体开发及生产环境最佳实践。参与者可参加关于 Deep Agents 智能体工具和 LangSmith Engine 的研讨会。活动名额有限,需提前报名。行业LangChainLangSmithDeep Agents推荐理由:LangChain 在三城举办智能体开发线下活动,有实战工作坊和最佳实践分享原文稍后读已读值得跟进有用关注 LangChain
04:04DeepLearning.AI@DeepLearningAI73°OpenAI展示GPT 5.6 Sol每秒处理750个token。Google发布Gemini 3.7 Flash平均每秒330个token。Nvidia推出Nemotron 3.5 Lightning并配备NeMo Switchyard动态步进路由技术。更快的吞吐量和更低的延迟可减轻开发者上下文切换负担。这些模型支持实时智能体工作流。AI模型GPT 5.6Gemini 3.7Nemotron 3.510 个信源在谈事件专题推荐理由:OpenAI、Google和Nvidia都在竞相提升AI模型推理速度,各有不同技术方案。原文稍后读已读值得跟进有用关注 GPT 5.6
03:58Fireworks AI@FireworksAI_HQ73°LangChain每天生成数十亿个智能体轨迹token,这是了解真实用户反应的最丰富信号。使用GPT-5.5或Opus等前沿闭源模型评估每个轨迹成本过高。Fireworks在Qwen基础模型上进行了微调,成本可降低高达100倍。该合作使开发者能够以更低成本构建前沿AI系统。AI产品LangChainQwenGPT-5.5推荐理由:LangChain和Fireworks合作,用微调Qwen模型替代GPT-5.5等昂贵模型,评估智能体轨迹成本降低100倍。原文稍后读已读值得跟进有用关注 LangChain
03:46lmarena.ai@lmarena_aiFable 5.1 版本现已发布,用户可在 arena.ai 平台测试。该模型新增了战斗模式和智能体模式两种使用方式。目前已有 1640 次查看和 9 次点赞。AI产品Fablearena.ai智能体推荐理由:Fable 5.1 上线了战斗和智能体两种模式,在 arena.ai 就能体验。原文稍后读已读值得跟进有用关注 Fable
03:28Milvus@milvusioMilvus 3.0 发布 StructArray 功能,允许在单个实体内存储多个元素。每个元素可包含向量和元数据,支持视频片段、多图像产品文档等场景。新功能提供元素级搜索和 EmbeddingList 搜索,适用于 ColBERT、ColPali 和智能体记忆等应用。AI产品Milvus向量数据库多模态推荐理由:Milvus 3.0 新增 StructArray,一个实体可存多个向量,视频搜索、文档检索更精准。原文稍后读已读值得跟进有用关注 Milvus
03:21官方一手Google DeepMind: Blog(博客/媒体)Google发布Gemini新功能,支持智能体视频理解。该功能能分析视频内容并回答相关问题。Gemini在视频理解基准测试中表现优异。此功能已向部分用户开放使用。AI产品Gemini视频理解智能体推荐理由:Google给Gemini加了视频理解新功能,能看懂视频内容并回答问题,比普通视频分析更智能。原文稍后读已读值得跟进有用关注 Gemini
03:18lmarena.ai@lmarena_ai78°Anthropic的Fable 5.1模型现已加入Arena评测平台。该模型在数百万真实世界长周期智能体任务中进行测试。模型可访问网络搜索、文件系统和终端工具完成复杂工作流。评测使用因果追踪方法衡量模型相对于平均模型的表现。AI模型FableAnthropicClaude10 个信源在谈事件专题推荐理由:Anthropic新推Fable 5.1,能在智能体任务中使用多种工具,比平均模型表现更优。原文稍后读已读值得跟进有用关注 Fable
02:53OpenRouter@OpenRouterAI78°Claude Fable 5.1 是 Fable 5 的直接升级版本,已在 OpenRouter 平台上线。该版本在智能体编程、长时间运行工作流、可视化代码生成、金融和分析领域有显著提升。用户可通过 openrouter.ai/anthropic/clau 访问此模型。AI模型ClaudeFableAnthropic10 个信源在谈事件专题推荐理由:Anthropic 发布了 Fable 5.1,在编程和金融分析方面表现更好,OpenRouter 已可使用。原文稍后读已读值得跟进有用关注 Claude
02:46mem0@mem0ai当前模型竞赛差距极小,1%的性能差异难以决定胜负。在实际应用中,能够持续工作的智能体比基准测试中高出2%但会遗忘会话内容的智能体表现更好。持久性智能体能够记住上下文,避免重复提问,提升用户体验。AI模型智能体模型竞赛持久性推荐理由:模型性能差距微小,持久性智能体比短期表现更优,实际应用中更实用。原文稍后读已读值得跟进有用关注 智能体
02:44官方账号NVIDIA AI@NVIDIAAINVIDIA与CrowdStrike合作测试SafeMind智能体系统。该系统通过AI模拟攻击,将遥测数据转化为检测规则,并测试新攻击路径。测试结果显示系统能够防御未见过的攻击类型。CrowdStrike的SafeMind系统在网络安全领域展现了创新应用。行业SafeMindCrowdStrikeNVIDIA5 个信源在谈事件专题推荐理由:NVIDIA和CrowdStrike合作测试了SafeMind智能体系统,能自动防御未知攻击,比传统安全系统更智能。原文稍后读已读值得跟进有用关注 SafeMind
02:23官方账号Logan Kilpatrick@OfficialLoganKGoogle发布了关于智能体视频的博客文章。Gemini在视频理解基准上继续保持最先进水平。用户可以通过博客了解更多技术细节。Google期待收集更多用户反馈。AI产品Gemini视频理解智能体推荐理由:Google分享了Gemini在视频理解方面的最新进展,SOTA表现值得关注。原文稍后读已读值得跟进有用关注 Gemini
02:19Philipp Schmid@_philschmid73°Gemini 3.7 Flash、3.6 Flash和3.5 Flash Lite模型现已支持智能体视频理解功能。该功能可迭代导航视频时间线,自主选择观看内容、帧率和所需信息类型。在长视频处理中,可减少88%的token数量和66%的成本,并在基准测试中提高约7%的准确率。用户可通过设置processing="agentic"启用此功能。AI产品GeminiGemini 3.7 Flash视频理解推荐理由:Gemini API新增智能体视频理解,能自主分析长视频,大幅降低成本并提高准确率。原文稍后读已读值得跟进有用关注 Gemini
02:18官方账号Google DeepMind@GoogleDeepMind73°Google为最新Gemini模型添加了智能体视频理解功能。新模型能以更高精度分析视频,同时减少高达88%的token使用量。这一功能提升了视频内容处理的效率和准确性。AI模型Gemini视频理解智能体推荐理由:Google给Gemini模型加上了视频理解功能,比以前少用88%的token,分析视频更准了。原文稍后读已读值得跟进有用关注 Gemini
02:13Patrick Loeber@patloeber精选73°Google发布了Gemini的智能体视频理解功能,这是一种让Gemini使用工具并动态分析视频的新方式。该功能可减少高达88%的token消耗,降低最多66%的成本。Google还提供了开发者指南,帮助用户轻松上手使用这一功能。AI产品Gemini智能体视频生成推荐理由:Google让Gemini能动态分析视频,大幅降低token和成本,还附带了开发指南。原文稍后读已读值得跟进有用关注 Gemini
01:58Google AI Developers@googleaidevsGemini 3.7 Flash引入了新的智能体视频理解功能,能够准确识别并计数每一次拍手。传统AI处理视频时默认采用固定1帧/秒的速度,容易漏掉快速动作。Gemini通过自动调整处理速度解决了这一难题,避免了将拍手误判为其他快速动作。AI模型GeminiGemini 3.7 Flash视频理解推荐理由:Google的Gemini 3.7 Flash新增智能体视频理解功能,能自动调整处理速度准确计数拍手,解决了传统AI处理快速动作的难题。原文稍后读已读值得跟进有用关注 Gemini
01:58Google AI Developers@googleaidevs精选Google发布Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型,新增智能体视频理解功能。用户可通过Gemini API上传视频或分析YouTube内容。该功能已在Google AI Studio和Gemini Enterprise Agent Platform上线。AI模型GeminiGemini 3.7 Flash智能体推荐理由:Google让Gemini系列模型看懂视频了,API直接调用,比之前强不少。原文稍后读已读值得跟进有用关注 Gemini
01:43OpenRouter@OpenRouterAIOpenRouter在基准浏览器中新增图像模型浏览功能。用户可在智能体或聊天室中快速编辑提示词。该功能帮助开发者更高效地测试不同图像生成模型。OpenRouter平台持续优化AI工具使用体验。技巧OpenRouter图像模型提示词工程推荐理由:OpenRouter上线图像模型提示词编辑功能,在聊天室就能快速测试不同模型效果。原文稍后读已读值得跟进有用关注 OpenRouter
01:41官方一手OpenAI Blog(博客/媒体)精选Basis、Clay和Exa Labs三家公司使用AI智能体优化客户入职流程、账户管理和开发者集成。这些AI原生企业展示了如何将AI技术融入日常运营。企业领导者可以借鉴这些实践案例。行业AI原生公司智能体工作流10 个信源在谈事件专题推荐理由:OpenAI分享三家AI原生公司如何用智能体提升运营效率,值得企业管理者参考。原文稍后读已读值得跟进有用关注 AI原生公司
00:58官方账号Replit@Replit精选Replit 发布了在平台上构建个性化邮件助手的深度教程。该教程采用直播形式,展示了完整的开发流程。Replit 是一个在线编程环境,用户无需本地配置即可开始开发。教程针对想要创建邮件自动化功能的开发者设计。技巧Replit邮件助手编程教程推荐理由:Replit教你一步步做邮件助手,在线就能开发,不用配置环境原文稍后读已读值得跟进有用关注 Replit
00:34官方一手AWS Machine Learning Blog@Rajesh Babu Nuvvula精选Atos通过AI League活动在三天内培训了400名工程师。工程师们在AWS平台上构建了多智能体系统。这种实践学习方式弥补了理论学习的不足。活动展示了企业如何实施AI技能提升计划。技巧AtosAWS多智能体推荐理由:Atos用3天让400工程师在AWS上实战多智能体系统,比纯理论学习效果好多了。原文稍后读已读值得跟进有用关注 Atos
00:33elvis@omarsar0精选73°该论文提出了一种新方法解决AI智能体的奖励黑客问题。研究覆盖了8个前沿模型,来自5个不同模型家族。奖励黑客发生率从23.6%降至5.3%,混合效应比值比为9.2。该方法为智能体提供了结构化的升级工具,在遇到测试基础设施缺陷时进行报告。该方法同时增加了10.1百分点的缺陷检测覆盖率,准确率达99.4%。论文奖励黑客智能体OpenAI10 个信源在谈事件专题推荐理由:OpenAI与HuggingFace事件后,这篇论文提出了解决奖励黑客的新方法,效果显著且无性能开销。原文稍后读已读值得跟进有用关注 奖励黑客
00:18eric zakariasson@ericzakariasson精选73°Lingxi Li分享了他如何运行一个由Grok机器人组成的工程团队来构建Grok机器人。他将Grok机器人视为拥有自己计算机的敏锐工程实习生,通过专业化分工(iOS、桌面、基础设施、Android、Harness)保持机器人专注。机器人可以启动云代理、检查证明、解决故障并持续工作直到达到标准。在需要VPN、iOS模拟器或截图时,机器人可在本地机器上运行。通过Notion绕过上下文限制,机器人可以跟踪bug、CI冲突,并在安全时自动合并。AI产品GrokLingxi Li工程团队3 个信源在谈事件专题推荐理由:Lingxi分享如何用200多个Grok机器人替代15个手动云代理,实现自动化工程管理。原文稍后读已读值得跟进有用关注 Grok
00:08官方一手AWS Machine Learning Blog@Chris Wajule精选t54在Amazon Bedrock AgentCore上构建了x402-secure信任层,该系统会在自主代理付款前对每个端点进行评分。该系统通过会话预算、凭证隔离和确定性信任门控,已管理超过2000万次代理发起的交易,无需人工干预。AI产品t54Amazon BedrockAgentCore1 个信源在谈事件专题推荐理由:t54用信任层让AI代理安全支付,已处理2000万次交易零失误原文稍后读已读值得跟进有用关注 t54
23:58官方一手marktechpost@Asif Razzaq精选73°AQuA是由普林斯顿、蚂蚁集团和斯坦福研究人员开发的双部分智能体框架。该框架专注于量化金融中的自主因子发现和模型开发。研究解决了量化研究代理在实验中可能污染证据的问题。AQuA通过分离作者和审查者角色来避免共享盲点。AI模型AQuA量化金融因子发现推荐理由:蚂蚁集团等机构推出AQuA框架,解决量化金融模型开发中的数据污染问题。原文稍后读已读值得跟进有用关注 AQuA
23:48Aravind Srinivas@AravSrinivas精选Perplexity为Mac应用所有用户引入混合计算功能。该功能允许Computer编排可在本地Mac上运行的语言模型。特别适用于处理敏感和私人文件的智能体步骤,如血液检查结果、纳税申报和诉讼文件等。AI产品PerplexityMac应用混合计算推荐理由:Perplexity Mac应用现在支持本地处理敏感文件,混合计算功能让用户隐私更安全。原文稍后读已读值得跟进有用关注 Perplexity
23:43Viking@vikingmuteGPT-5.6 Sol Ultra 在大项目重构和新项目多模块同时实现中表现突出。该模型消耗时间和token量较大,存在过度思考问题。用户反馈 Sol High 版本已能满足出计划需求。建议搭配 Luna Max 或其他干活agent使用效果更佳。AI模型GPT-5.6Sol UltraSol High推荐理由:GPT-5.6 Sol Ultra 耗时耗token,过度思考,Sol High 加干活agent组合更实用原文稍后读已读值得跟进有用关注 GPT-5.6
21:45Richard Socher@RichardSocher73°Braintrust研究评估了1,329个时事问题,对比4个模型在14种条件下的表现。搜索功能将模型间差距从47.9分缩小至5.6分。检索增益随事件时间衰减,近期事件约45分,最旧事件约24分。5次以上搜索的得分反而下降19-49%。AI模型Braintrust搜索优化模型性能推荐理由:Braintrust研究显示,搜索功能能让不同模型表现趋同,但搜索次数过多反而会降低准确率。原文稍后读已读值得跟进有用关注 Braintrust
19:28Dify@dify_aiDify团队分享了其Agent产品的开发思路。该产品专注于将Agent的灵活性融入业务流程。团队提供了产品经理实际使用Agent和Workflow的案例。文章详细介绍了产品如何实现可信任、可管理和持续运行。AI产品DifyAgent智能体推荐理由:Dify团队分享Agent产品幕后故事,展示如何将Agent融入实际业务流程,还有真实使用案例。原文稍后读已读值得跟进有用关注 Dify
17:05Viking@vikingmute精选Vercel发布了一篇关于如何使用design.md文件让各种编码代理生成符合品牌设计页面的文章。他们通过公开的design.md和CSS文件,将header、表格、数据条、图表等设计元素定义为有限的class/token。代理只需在HTML中使用这些预定义名称,无需自行设计字号、间距和布局。文章还提供了Build your own教程,指导读者从头开始构建类似系统。技巧Verceldesign.mdcoding agent2 个信源在谈事件专题推荐理由:Vercel分享了一套让AI生成品牌一致页面的实用方法,通过design.md和CSS文件规范设计元素,还有详细教程教你如何自己搭建这套系统。原文稍后读已读值得跟进有用关注 Vercel
16:43shao__meng@shao__meng精选73°Grok Bot平台被拆解为25个核心概念,涵盖Bot本体、运行环境、能力层、协作机制和人的控制权五大模块。每个Bot都是独立智能体,拥有名字、职位、描述、技能和独立对话能力。Bot运行在共享云端环境,支持浏览器、文件工作区和终端访问。平台提供插件、Skills、任务教学、定时触发和事件触发五大能力,支持Bot间协作和人工控制。AI产品Grok Bot智能体Agent推荐理由:@nateherk详解Grok Bot的25个核心概念,从Bot本体到协作机制,帮你理解如何构建智能体团队。原文稍后读已读值得跟进有用关注 Grok Bot
16:38IT之家(博客/媒体)腾讯公司公关总监张军宣布,即日起在职老师和高校大学生完成身份认证可领取WorkBuddy 1000开学专属积分。全国普通高等学校(除港澳台)在读大学生和通过教育部'中国教师'小程序认证的在职教师均可参与。WorkBuddy是腾讯云推出的桌面Agent工具,支持自然语言指令和多模态任务处理。AI产品WorkBuddy腾讯云桌面Agent推荐理由:腾讯给老师和大学生发WorkBuddy积分,能免费用这个能自动处理文件、生成文档表格PPT的桌面Agent工具。原文稍后读已读值得跟进有用关注 WorkBuddy
15:59小互@imxiaohu73°Google Research 发布了 WikiSkill 框架,旨在让 AI Agent 将任务执行中的经验和教训沉淀为持久知识库。该框架模仿维基百科模式,使 AI 能从零散经验中积累可执行技能。WikiSkill 帮助 AI Agent 实现自我进化,持续提升任务执行能力。AI模型WikiSkillGoogle ResearchAI Agent3 个信源在谈事件专题推荐理由:Google Research 的 WikiSkill 让 AI 把踩过的坑变成可积累的技能,像维基百科一样持续进化。原文稍后读已读值得跟进有用关注 WikiSkill
15:58小互@imxiaohu精选73°xAI 连续发布五篇 Grok Bot 内部实践指南。有人用六个 Bot 运营移动游戏,设计师用 Bot 制作原型,Enterprise GTM 团队将拓客和会议交给 Bot 团队。每个 Bot 都是长期存在的 Agent,拥有记忆、工具连接和云端电脑。重点在于组织能力、防止角色越权以及保留哪些人工操作。技巧Grok BotxAIAgent推荐理由:xAI 分享了五组 Grok Bot 实践案例,展示如何用多个 Bot 组成 Agent 操作系统,每个 Bot 有独立记忆和工具连接。原文稍后读已读值得跟进有用关注 Grok Bot
14:46Browser Use@browser_use精选Browser Use CLI 是一款专为AI设计的浏览器工具。该工具允许AI代理执行浏览器操作任务。开发者可通过它构建类似Instinct的应用。该工具与Daytona.io和PhotonHQ等产品集成使用。AI产品Browser Use CLIInstinctDaytona推荐理由:Browser Use CLI让AI能操作浏览器,配合Daytona和PhotonHQ可构建实用应用。原文稍后读已读值得跟进有用关注 Browser Use CLI
13:53IT之家(博客/媒体)Manus于9月1日正式宣布恢复独立运营,由创始人肖弘、首席科学家季逸超及联合创始人张涛组成的创始团队继续领导。此前经历运营主体变更的部分用户需进行数据备份与恢复,公司已提供恢复门户且无截止时间限制。作为通用AI智能体实验室,Manus将持续推进产品创新并融入用户工作流程。行业Manus肖弘季逸超推荐理由:Manus恢复独立运营了,创始团队全留任,之前受影响的数据还能恢复,以后会更主动帮你做事。原文稍后读已读值得跟进有用关注 Manus
11:53IT之家(博客/媒体)中央网信办网络安全协调局副局长王丽宏介绍,当前AI领域主要面临5方面安全风险挑战。技术先天脆弱性影响输出稳定性,深度学习算法可解释性欠缺。模型能力跃迁颠覆传统安全范式,近期多家科技巨头曝出大模型失控事件。应用形态快速演进,智能体从"回答问题"走向"执行任务",安全风险从"生成有害内容"向"自主实施行动"跃迁。行业中央网信办AI安全智能体1 个信源在谈事件专题推荐理由:中央网信办详解AI五大安全风险,包括技术漏洞、模型失控、智能体威胁、误用滥用和技术霸权。原文稍后读已读值得跟进有用关注 中央网信办
11:53GitHub@githubGitHub Copilot应用现在支持在单一界面中完成聊天和开发工作。用户可以在应用内启动项目、运行多个智能体会话、使用快速聊天功能,并通过浏览器画布预览应用。该功能旨在减少在不同界面间切换的需要,提高开发效率。AI产品GitHub Copilot智能体编程助手推荐理由:GitHub Copilot应用整合了聊天和开发功能,不用来回切换界面就能完成项目开发。原文稍后读已读值得跟进有用关注 GitHub Copilot