03:46Aravind Srinivas@AravSrinivas73°Decagon 为 Delta 航空、Ticketmaster 等大品牌提供客户支持服务。该公司与 Perplexity 合作,为智能体接入实时网络搜索功能。支持人员可在对话中搜索最新信息,并附上引用来源。客户问题常依赖每小时变化的信息,此功能解决了这一痛点。AI产品DecagonPerplexity客户支持推荐理由:Decagon 接入 Perplexity 搜索,客服能实时获取最新信息回答客户问题。原文稍后读已读值得跟进有用关注 Decagon
03:21官方账号Perplexity@perplexity_ai73°GLM 5.3 现已在 Perplexity Computer 平台可用。该模型专为长上下文、多模态智能体工作负载设计。在 WANDR 基准测试中,GLM 5.3 的表现优于 GLM 5.2。WANDR 是用于大规模、有证据支持研究的基准测试。AI模型GLMPerplexity Computer多模态推荐理由:Perplexity 上线了 GLM 5.3,专为长上下文多模态任务优化,在 WANDR 基准上超越了前代模型。原文稍后读已读值得跟进有用关注 GLM
03:21官方账号LangChain@LangChainAI精选Clay团队分享了每月3亿+次智能体评估的扩展方法。他们介绍了四象限评估框架。生产环境到评估的闭环是最困难的部分。数据湖和长上下文改变了智能体处理数据的能力。技巧Clay智能体评估框架推荐理由:Clay团队分享每月3亿+智能体评估经验,教你如何构建评估框架和闭环。原文稍后读已读值得跟进有用关注 Clay
02:47Guillermo Rauch@rauchgVercel发布eve智能体创建平台,用户可在1分钟内部署生产级智能体。该平台提供完整的Git仓库,用户拥有整个智能体栈的所有权,包括运行时、模型选择、技能、工具等。用户只需添加提示词、选择模型和MCP连接即可完成部署。AI产品eveVercel智能体推荐理由:Vercel的eve让你一分钟拥有自己的智能体,还给你完整的Git仓库控制权。原文稍后读已读值得跟进有用关注 eve
02:41官方账号LangChain@LangChainAI精选UnifyGTM在产品发布前两周发现其智能体单条消息就能消耗完客户预算。公司联合创始人兼CTO HeggieConnor分享了如何将成本降低90-95%的具体方法。该优化措施确保了产品正式发布时的成本效益。AI产品UnifyGTM智能体成本优化推荐理由:UnifyGTM联合创始人分享如何将智能体计算成本降低90-95%,避免客户预算被单条消息耗尽。原文稍后读已读值得跟进有用关注 UnifyGTM
02:16Jerry Liu@jerryjliu0精选LlamaParse引入了原生智能体电子表格提取功能,可处理任意行列数的复杂表格。该功能通过调整的智能体引擎实现大规模模式引导提取,准确率极高。用户可在高级处理选项中开启"电子表格提取",将资产负债表等密集表格提取为结构化数据。AI产品LlamaParse电子表格提取智能体推荐理由:LlamaParse新增电子表格提取功能,能准确处理复杂表格结构,比传统OCR更适合电子表格格式。原文稍后读已读值得跟进有用关注 LlamaParse
02:08官方账号Andrew Ng@AndrewYNg精选Andrew Ng发布了AI工程技能图,展示了智能体编程如何改变软件工程基础。该技能图涵盖了从基础编程到高级AI应用的完整路径。Ng强调了在智能体时代,软件工程师需要掌握的新技能组合。技能图包含从传统编程到AI辅助开发的过渡指南。技巧Andrew Ng智能体AI工程推荐理由:Andrew Ng分享的AI工程技能图,清晰展示了智能体编程时代软件工程师需要掌握的新技能路径。原文稍后读已读值得跟进有用关注 Andrew Ng
01:46eric zakariasson@ericzakariassonX.ai 推出了 Grok Bot 的新功能,用户现在可以分享自己的 Bot 模板。Projects Manager 工具允许创建和管理多个 Grok Bot 组成的团队。用户可以通过特定链接安装 Bot,并让 Bot 创建专业助手如程序员、设计师、研究员和作家。AI产品GrokX.aiBot推荐理由:X.ai 让 Grok Bot 支持团队协作,Projects Manager 能帮你管理多个专业 Bot。原文稍后读已读值得跟进有用关注 Grok
01:31官方账号Replit@ReplitReplit发布了智能模型路由功能,可根据任务自动选择最佳模型。该系统支持多种AI模型,包括GPT-4和Claude。Replit表示此功能可提高编程效率,减少用户手动选择模型的麻烦。该功能已在Replit平台上线,面向所有用户开放。AI产品ReplitGPT-4Claude推荐理由:Replit上线智能模型路由,自动为编程任务匹配合适模型,不用手动切换了。原文稍后读已读值得跟进有用关注 Replit
01:19官方账号LangChain@LangChainAILangChain Academy团队将于9月17日举办Deep Agents线上工作坊。参与者将学习如何构建自己的Deep Agent。工作坊将介绍规划、记忆和子代理如何让代理执行复杂的多步骤任务。活动已在events.langchain.com上开放报名。技巧Deep AgentsLangChain智能体推荐理由:LangChain教你构建Deep Agent,掌握规划、记忆和子代理技术,实现复杂任务自动化。原文稍后读已读值得跟进有用关注 Deep Agents
00:13OpenRouter@OpenRouterAI73°Zai公司发布了GLM-5.3模型,现已开放权重并可在OpenRouter使用。该模型拥有100万上下文窗口,支持可配置推理强度。GLM-5.3专为复杂软件工程、长周期智能体和网络安全设计。模型权重已上传至Hugging Face平台。AI模型GLM-5.3ZaiOpenRouter4 个信源在谈事件专题推荐理由:Zai开源了GLM-5.3,支持百万上下文,适合编程和网络安全,还能自己下载运行定制。原文稍后读已读值得跟进有用关注 GLM-5.3
23:57IT之家(博客/媒体)73°OpenAI 在 Codex 命令行版本中加入持久模式,该功能允许模型持续工作直到被休眠。持久模式位于 Codex 的推理强度菜单中,用户可控制算力、Token 和时间投入。该模式包含主动性功能,智能体能跨会话执行任务并主动安排后续工作,但不会扩大原有操作权限。AI产品OpenAICodex持久模式10 个信源在谈事件专题推荐理由:OpenAI 正在测试 Codex 持久模式,能让 AI 主动长时间工作,比普通模式更强大。原文稍后读已读值得跟进有用关注 OpenAI
23:24Hunyuan@TXhunyuan腾讯混元Hy4预览版已在WorkBuddy平台上线,免费使用两周。该模型在研究任务、Office办公、前端开发和游戏开发领域表现优异。Hy4预览版能完成端到端智能体工作流,不仅能回答问题,还能完成多步骤生产力任务。Hy3版本将免费使用至九月底。AI产品Hy4TencentHunyuanWorkBuddy推荐理由:腾讯混元Hy4预览版免费两周,在多领域任务表现优异,比Hy3更强大。原文稍后读已读值得跟进有用关注 Hy4
22:26Aravind Srinivas@AravSrinivasPerplexity Computer现已与Public平台正式连接。用户可将券商账户接入Perplexity,在一个AI驱动的界面中研究并交易股票、期权、加密货币、债券和国库券。这项整合为投资者提供了统一的交易和研究体验。AI产品PerplexityPublicAI交易推荐理由:Perplexity接入了券商Public,现在能在一个界面里用AI研究并交易多种金融产品。原文稍后读已读值得跟进有用关注 Perplexity
22:24官方账号Google AI@GoogleAIFlow by Google 即将推出升级功能。Gemini App 将扩展场景功能,正在全球范围内向所有 Google AI Plus、Pro 和 Ultra 订阅用户推出。用户现在可以直接在 Google AI Studio 中构建,并在 Gemini Enterprise Agent Platform 上部署。AI产品FlowbyGoogleGeminiAppGoogleAIStudio推荐理由:Google 为 Flow 和 Gemini App 带来了新功能,订阅用户可直接在 AI Studio 中构建并部署到企业平台。原文稍后读已读值得跟进有用关注 FlowbyGoogle
22:20官方账号Decoder@Matthias Bastian沃顿商学院研究显示,AI购物代理行为不稳定。仅更换一个外部信息源如Wirecutter,产品选择率就变化高达99个百分点。即使信息完全相同,仅改变信息顺序也会导致不同结果。AI产品AI购物代理Wirecutter沃顿商学院推荐理由:沃顿研究揭露AI购物代理的不可靠性,一个信息源就能让选择率变化99%,远未达到实用水平。原文稍后读已读值得跟进有用关注 AI购物代理
22:12lmarena.ai@lmarena_aiGrok-4.6在Agent Arena排行榜中位列第15名,实现了6.1%的净提升。该模型在确认成功指标上表现突出,提升了13.2%。在工具幻觉方面表现稳定,仅提升1.0%。 bash恢复能力提升了8.8%,可操控性提升4.9%。AI模型Grok-4.6Agent Arena智能体推荐理由:Grok-4.6在Agent Arena排名上升,确认成功指标提升13.2%,bash恢复能力显著增强。原文稍后读已读值得跟进有用关注 Grok-4.6
22:08官方账号LangChain@LangChainAILangChain Academy发布了智能体工程基础课程,涵盖react循环、MCP服务器等核心概念。课程从零开始教授智能体工程基础知识,包含人在回路设计。该课程面向所有对智能体开发感兴趣的学习者。技巧LangChain智能体react循环推荐理由:LangChain教你从零开始构建智能体,包含react循环和MCP服务器等实用内容。原文稍后读已读值得跟进有用关注 LangChain
21:55Jerry Liu@jerryjliu0精选LlamaParse平台新增原生智能体电子表格提取功能,可处理任意行列数的表格。该功能通过调整的智能引擎直接读取原始单元格,而非将表格扁平化为文本。目前已在agentic_plus层级的beta版本中可用,支持.xlsx、.xls和.csv文件格式。AI产品LlamaParse电子表格LlamaIndex1 个信源在谈事件专题推荐理由:LlamaParse上线原生电子表格提取,直接读取单元格数据而非文本转换,比传统方法更准确处理复杂表格。原文稍后读已读值得跟进有用关注 LlamaParse
21:52Google Gemini App@GeminiAppGemini Live获得生产力升级,新增智能体能力。用户可通过语音听取每日简报、分类邮件或获取Spark帮助。此次更新使Gemini Live支持更多语音交互场景。AI产品GeminiGemini Live智能体推荐理由:Gemini Live新增语音智能体功能,能帮你听简报、分类邮件,比普通语音助手更实用。原文稍后读已读值得跟进有用关注 Gemini
21:51elvis@omarsar0Keenable的NEEDLE基准测试发现,Brave、You和Parallel三个搜索引擎在错误结果上有70-90%的重叠度。对于智能体而言,只有当底层索引真正独立时,结合多个提供商才能提高覆盖率。搜索API的界面可能不同,但返回的错误结果可能高度一致。论文NEEDLEBraveYou推荐理由:Keenable的NEEDLE基准测试显示不同搜索引擎错误结果高度重叠,这对智能体组合提供商有重要启示。原文稍后读已读值得跟进有用关注 NEEDLE
21:49官方账号LangChain@LangChainAI精选LangSmith平台让Morningstar公司能够在一个地方追踪每个智能体的决策过程。高级软件工程师Matt Trivett分享了使用LangSmith前后的调试体验。该工具提供了完整的决策追踪功能,帮助开发者快速定位问题。AI产品LangSmithMorningstar智能体推荐理由:Morningstar工程师用LangSmith解决了智能体调试难题,每个决策都能追踪查看。原文稍后读已读值得跟进有用关注 LangSmith
21:46官方账号Anthropic@AnthropicAI精选Anthropic 发布 MHS 接口,将 AI 与硬件的集成时间从数天或数周缩短至数小时或数分钟。该接口使设备可被发现,并确保 AI 智能体能够安全操作硬件。MHS 解决了当前 AI 与硬件集成缺乏标准化方法的问题。AI产品AnthropicMHS智能体7 个信源在谈事件专题推荐理由:Anthropic 新出的 MHS 接口能让 AI 连接硬件快很多倍,还保证安全操作。原文稍后读已读值得跟进有用关注 Anthropic
21:45官方一手Anthropic: Newsroom(资讯)精选Anthropic宣布开放模型硬件标准(MHS)研究预览,面向首批科研实验室和先进制造商。MHS是AI操作物理设备的共享规范,旨在确保安全操作。该标准将帮助AI系统与物理世界进行更安全的交互。首批参与者包括多家领先科研机构。AI产品AnthropicMHSAI安全9 个信源在谈事件专题推荐理由:Anthropic发布了MHS研究预览,这是AI安全操作物理设备的共享规范,首批已开放给科研实验室和制造商。原文稍后读已读值得跟进有用关注 Anthropic
21:43官方账号Greg Brockman@gdbChatGPT Work成功为用户预约了90分钟前的理发服务。该功能展示了AI助手在日常生活中的实际应用能力。用户通过ChatGPT完成了理发预约这一具体任务。AI产品ChatGPTChatGPT WorkAGI推荐理由:ChatGPT Work成功帮你预约理发,展示了AI助手处理日常事务的能力原文稍后读已读值得跟进有用关注 ChatGPT
21:29elvis@omarsar0精选DAIR.AI团队发布新论文,将智能体轨迹压缩为有限状态机。研究显示,12个公共数据集上状态机仅需7-43个状态,回放数据拟合度达0.997。有限状态机上下文在12个数据集上均优于Agent Workflow Memory,失败预测AUROC最高达0.94。论文AutomataDAIR.AI智能体推荐理由:DAIR.AI发现智能体行为更多受部署框架影响而非底层模型,能提前预测任务失败。原文稍后读已读值得跟进有用关注 Automata
21:22elvis@omarsar073°Google研究人员提出了一种新的智能体技能进化方法,将执行轨迹、持久化知识库和可执行技能分离。该方法通过将经验整合到知识库中,使后续技能更新基于累积知识而非分散优化历史。实验表明,较小规模的模型通过进化技能可以显著超越更大规模但未进化技能的模型。此外,一个模型进化出的技能可以跨模型家族迁移,有时甚至优于模型自我进化的技能。论文Google智能体技能进化推荐理由:Google这篇论文教你如何让AI智能体通过持久化知识库保持技能,小模型进化技能后能打败大模型。原文稍后读已读值得跟进有用关注 Google
21:16Guillermo Rauch@rauchgvgpu.sh 是 Vercel 团队开发的开源 WebGPU 库,专为智能体设计。该工具支持在浏览器或无头 Node.js 中运行,可在 CPU 沙箱和 CI 测试中渲染。vgpu.sh 允许创建可重用的 .wgsl 模块,最初是为在 vercel.com 上部署着色器而构建。AI产品vgpu.shWebGPUVercel推荐理由:Vercel 团队开源了专为智能体设计的 WebGPU 工具,支持浏览器和 Node.js,还能在 CI 测试中渲染。原文稍后读已读值得跟进有用关注 vgpu.sh
21:10官方一手Cloudflare Blog@Julian LaxmanCloudflare为机器人运营商推出了BotBase管理平台,可在仪表板中管理提交。该平台提供提交状态跟踪功能,让运营商实时了解审核进度。运营商可编辑提交内容,并通过行为模型准确声明机器人如何使用内容。AI产品CloudflareBotBase机器人推荐理由:Cloudflare新增BotBase平台,让机器人管理更清晰,可跟踪状态和编辑提交。原文稍后读已读值得跟进有用关注 Cloudflare
21:06官方一手AWS Machine Learning Blog@James Wu精选创意团队生产资产数量激增,但工具碎片化和手动上下文传递拖慢了生产进度。本文展示如何通过模型上下文协议(MCP)连接Amazon Quick和fal,构建可重用的智能体工具集。文章提供了两个实际工作流:八分格故事板制作和音乐视频概念原型设计。技巧Amazon QuickfalMCP推荐理由:AWS教你用Quick和fal通过MCP协议连接,解决创意工具碎片化问题,提供故事板和MV原型两个实用工作流。原文稍后读已读值得跟进有用关注 Amazon Quick
20:51Lovable@lovable_devLovable平台现已允许用户为任何应用添加MCP协议支持。开发者可以通过官方文档快速实现这一功能。该功能已在Lovable开发者文档中详细说明。技巧LovableMCP工具推荐理由:Lovable开放了MCP集成,让你的任何应用都能接入工具生态原文稍后读已读值得跟进有用关注 Lovable
20:50Richard Socher@RichardSocherRichardSocher 发布了新型智能体模型,专注于准确性和响应时间。该模型在多项基准测试中表现出色,处理速度比前代产品提升 40%。该模型特别适合需要快速响应和精确结果的智能体应用场景。AI模型RichardSocher智能体准确率推荐理由:RichardSocher 新发布的智能体模型,在准确性和速度上都有显著提升,适合需要快速响应的智能体应用。原文稍后读已读值得跟进有用关注 RichardSocher
20:48elvis@omarsar0精选作者使用前沿模型进行编排和协调,配合开源廉价模型执行任务。这种组合使token使用量快速增长,支持开发更多主动型智能体。开源模型降低了自动化成本门槛,提高了项目可行性。AI模型开源模型智能体自动化推荐理由:开源模型搭配前沿模型,降低自动化成本,让更多主动型智能体成为可能。原文稍后读已读值得跟进有用关注 开源模型
20:43elvis@omarsar0Grok Bot简化了用户与AI代理的交互界面。该工具让用户不再过度思考问题。其主动功能正在持续改进中。用户对AI的信任度因此得到提升。AI产品Grok Bot智能体AI助手推荐理由:Grok Bot改变了我的工作方式,简化界面让我不再过度思考,主动功能很值得期待。原文稍后读已读值得跟进有用关注 Grok Bot
20:36Notion@NotionHQBrian Lovin展示了如何使用Grok Bot管理Notion数据库。该系统可让代理在Notion页面中记录工作进度和障碍。用户可通过聊天发送任务,这些任务通常会启动Cursor云会话来自动构建或修复。Notion MCP功能可自动设置整个系统,无需手动配置。技巧NotionGrok BotCursor4 个信源在谈事件专题推荐理由:Notion和Grok Bot结合,让你的AI助手同时处理多项任务并追踪进度。原文稍后读已读值得跟进有用关注 Notion
20:02官方账号arXiv cs.AI@Pranav Aggarwal精选73°研究显示,当LLM智能体面对专业外观的市场面板时,对不可预测问题的承诺率从6.5%跃升至54.0%。即使面板上的所有数字都是虚构的,承诺率仍从24.5%上升到36.8%,与真实数据产生的37.6%无显著差异。同一模型在可回答问题上准确率接近完美,表明问题不在于能力或信念,而在于行动决策机制。论文LLM Agents智能体AI安全推荐理由:Calibrated Enough论文揭示LLM智能体如何被虚假证据误导,以及如何通过微调修复这一缺陷。原文稍后读已读值得跟进有用关注 LLM Agents
19:45官方一手Pandaily@contact@pandaily.com (Pandaily)腾讯办公智能体WorkBuddy在上海家化从试点转为生产应用。该智能体覆盖了家化9个部门。数据显示,WorkBuddy使平均工作效率提升了4.5倍。上海家化拥有百年历史,是中国知名化妆品企业。AI产品WorkBuddy腾讯上海家化推荐理由:腾讯WorkBuddy在家化落地,9个部门效率提升4.5倍,看看实际应用效果如何。原文稍后读已读值得跟进有用关注 WorkBuddy
19:37官方账号arXiv cs.AI@Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong精选73°研究人员发现当前LLM智能体安全机制存在组合失效问题。传统安全监控器仅在单次轨迹内工作,无法检测跨迭代攻击。论文提出LoopHarness系统,通过持久化非衰减安全状态,将未授权操作期望数量控制在常数范围内。该研究在Agent-SafetyBench基准上进行了完整评估,包含清洁和攻击场景的配对测试。论文LLM AgentsAgent-SafetyBenchLoopHarness推荐理由:MIT学者发现LLM智能体安全漏洞,提出LoopHarness解决跨迭代攻击问题,安全性能显著提升。原文稍后读已读值得跟进有用关注 LLM Agents
19:31shao__meng@shao__meng精选73°腾讯 Hy4 preview 在 WorkBuddy 平台上线,8月28日至9月10日期间限时免费。目前已有2615位用户排队等待使用。该模型在软件工程、办公分析、游戏开发和科学研究四个领域有专门优化。评测显示,Hy4在18项国产模型对比中13项第一,但在抽象推理方面仍有差距。AI产品Hy4WorkBuddy腾讯推荐理由:腾讯Hy4在WorkBuddy上线,排队人多但能力强,国产模型中领先但抽象推理仍是短板。原文稍后读已读值得跟进有用关注 Hy4
19:04官方账号arXiv cs.AI@Yaxiao Liu, Pengbo Liu, Yiwen Liu, Yihua Guan, Zhenghe Hou, Jiaxing Song该研究提出了一种基于契约的可扩展智能体运行时架构,包含四个责任对象:Skill、Harness、Scaffold和独立CIO治理的数据底座。核心贡献是P1假设(成本感知能力-容量可分离性),在声明操作区域内,改变激活能力可保持容量响应交互,改变兼容Scaffold容量可保持能力语义。研究提出了集群周期随机交叉实验设计,包含四种状态判定:支持、证伪、条件工程或不明确。论文智能体运行时架构契约设计推荐理由:这篇论文提出了智能体运行时的契约架构,解决了企业AI部署中的协调问题,提出了可测试的假设和实验方法。原文稍后读已读值得跟进有用关注 智能体