04:13The Rundown AI@therundownai78°Meta发布了Muse Spark 1.3模型,相比1.2版本有显著提升。马克·扎克伯格称该模型达到了"前沿性能,几乎便宜到无法计量"。该模型在多项基准测试中表现出色。AI模型Muse SparkMeta模型升级推荐理由:Meta刚发布的Muse Spark 1.3性能大幅提升,价格却很亲民。原文稍后读已读值得跟进有用关注 Muse Spark
10:26官方账号arXiv cs.AI@Yutong Chen, Guangfu Guo, Zhichao Xu, Kunpeng LiuDualOPSD是一种不对称交替框架,自适应学生模型和教师模型。在Qwen3-8B上,DualOPSD在AIME 2024、AIME 2025和HMMT 2025上分别比OPSD提升了23.61、13.89和10.00个avg@12点。模型规模越大,准确率提升越明显。所有规模下,DualOPSD都减少了截断,4B规模下的诊断结果还显示教师和学生之间的KL散度更低。论文自蒸馏模型优化性能提升推荐理由:DualOPSD在模型规模和性能上都有显著提升,是自蒸馏领域的一个新突破。与OPSD相比,DualOPSD在多个基准测试中取得了更好的成绩,值得关注。原文稍后读已读值得跟进有用关注 自蒸馏
09:31官方账号arXiv cs.AI@Yi Zhou, Qipeng Wang, Yunqing Liu, Jun Xia, Qing Li, Wenqi Fan本文建立了一个三阶段研究框架,对三种代表性多模态蛋白质语言模型(pLMs)在四个基本任务上的推理设计空间进行实证研究。评估了vanilla采样、任务特定无分类器指导以及奖励引导的beam搜索,发现默认推理协议的低效性,并识别出针对任务的采样偏好;在任务上观察到显著的定量收益,一致地提升了多模态pLMs的性能上限,而不更新模型参数;得出与先前共识不同的关于基础模型的结论。论文多模态蛋白质语言模型推理时间推荐理由:这篇论文揭示了多模态蛋白质语言模型推理时间的关键性,并提出了改进策略,值得蛋白质语言模型研究者关注。原文稍后读已读值得跟进有用关注 多模态
09:25官方账号arXiv cs.AI@Weiming Li, Helen Paik, Yulei Sui现代GUI代理框架使用前沿API模型实现强大的桌面任务性能,但持续的控制系统信息通常隐含在增长的交互轨迹中。使用Qwen3.5-9B替换GPT-5将OSWorld SR-100的平均值从60.9%降低到37.7%。LocalLSTC通过时间范围组织控制,维护跨步骤的持续状态来指导短期执行承诺。使用Qwen3.6-27B,LocalLSTC在OSWorld上达到64.7%的SR-100,在WindowsAgentArena上达到65.3%,优于两个基准测试上的先前本地结果。论文LocalLSTC长期短期控制GUI代理推荐理由:LocalLSTC通过时间组织控制信息,显著提升了本地GUI代理的性能,值得研究。原文稍后读已读值得跟进有用关注 LocalLSTC
08:28官方账号Simon Willison’s Weblog(博客/媒体)精选Qwen 推出多模态 MoE 模型 Qwen3.8-Flash-Next,拥有 125B tokens,性能提升显著。模型在 DGX Spark 上运行,已尝试 72.5GB 和 78.9GB 版本,其中 UD-Q2_K_XL 版本表现最佳。AI模型Qwen多模态MoE 模型1 个信源在谈事件专题推荐理由:Qwen 推出全新多模态 MoE 模型,性能卓越,值得一试。与 Qwen4 架构相似,适合探索多模态应用。原文稍后读已读值得跟进有用关注 Qwen
02:23量子位@十三智谱AI发布GLM-5.3 Flash,首个原生多模态模型,支持国产卡。模型基于GLM-4升级,性能提升显著。AI模型智谱AIGLM-5.3 Flash多模态模型10 个信源在谈事件专题推荐理由:智谱AI发布首个多模态模型,性能强,支持国产卡,值得一试。原文稍后读已读值得跟进有用关注 智谱AI
22:43orange.ai@oran_ge端到端服务性能提升3倍,硬件效率和单token成本与英伟达GPU相当,证明国产芯片在大规模场景下的高效和经济性。AI模型国产芯片性能提升推理需求推荐理由:国产芯片性能大幅提升,与英伟达GPU比肩,支持前沿模型推理,值得关注!原文稍后读已读值得跟进有用关注 国产芯片
20:44IT之家(博客/媒体)72°阿里通义千问团队发布 Qwen3.8-Flash,125B 参数 MoE 模型,训练成本降为前代 1/9,性能更强。支持 1M 上下文,已开源。AI模型阿里通义Qwen3.8-FlashMoE 模型推荐理由:阿里通义新模型 Qwen3.8-Flash 开源,参数量大幅提升,训练成本降低,值得开发者关注。原文稍后读已读值得跟进有用关注 阿里通义
18:23IT之家(博客/媒体)Arm祝贺小米发布玄戒O3芯片,安兔兔跑分522万分,性能提升60%;苹果发布M6芯片,采用2纳米制程,性能全面升级。Arm发文祝贺小米和苹果新芯片发布,强调双方合作推动下一代计算技术。行业Arm小米苹果推荐理由:Arm发文祝贺小米和苹果新芯片发布,性能提升显著,值得关注。原文稍后读已读值得跟进有用关注 Arm
11:16官方账号arXiv cs.AI@Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar DavasamStarHarness是一个在固定模型权重的同时进化特定环境智能体框架的工具。它通过分层任务、分离搜索和选择任务,以及保留任务来评估泛化能力。在ITBench SRE、EnterpriseOps-Gym ITSM和AutomationBench Finance上,经过4-12次接受的变化,框架进化提高了基准性能20-35个百分点。这些改进在排除进化任务和跨GPT和Qwen模型家族的迁移中持续存在。跟踪分析将改进归因于接口修复、环境约定和压缩搜索的操作知识,减少了误诊和缩短了轨迹。因此,StarHarness为减少工具丰富的企业任务中的持续模型-环境不匹配提供了实用方法。AI模型StarHarness智能体MCP/工具推荐理由:StarHarness能够有效提高企业环境中智能体的性能,通过分层搜索和固定模型权重的方式,实现了20-35个百分点的性能提升,非常适合需要优化智能体性能的企业使用。原文稍后读已读值得跟进有用关注 StarHarness
11:15官方账号arXiv cs.AI@Boyang Liu, Senjie Jin, Peixin Wang, Zhangyue Yin, Yibo Wang, Yuhao Zhou, Xinbing Liang, Shizheng Zhu, Yuhui Wang, Jingqi Tong, Zhiheng Xi, Jiazheng Zhang, Clive Bai, Clarenceai, Blaze Chen, Tao Gui, Qi Zhang, Xuanjing HuangCAFE框架通过共享参数模型交替搜索代理和评论员角色,实现在线和离线优化。在七个代理搜索基准上,CAFE平均优于评估的基于RL的搜索代理,并在所有六个域外基准上保持其优势,同时减少了答案级别的幻觉。论文CAFE框架搜索代理协同进化推荐理由:CAFE框架通过协同进化的反馈机制,显著提升了搜索代理的性能,值得关注。原文稍后读已读值得跟进有用关注 CAFE框架
09:08IT之家(博客/媒体)Parallels Desktop 27 发布,新增基于 Metal 的图形驱动,支持 OpenGL 4.3,OpenGL 性能最高提升 160%,AI 矩阵计算最高提升 7 倍。AI产品Parallels DesktopOpenGLMetal推荐理由:Parallels Desktop 27 新增 Metal 图形驱动,OpenGL 性能大幅提升,AI 矩阵计算速度更快,适合需要高性能图形和 AI 运算的开发者。原文稍后读已读值得跟进有用关注 Parallels Desktop
02:58官方账号LangChain@LangChainAI精选LangSmith Engine在关键内部基准测试中性能提升超过2倍,已帮助客户识别数万个问题,新增功能包括更准确的检测、聚类和修复,支持SaaS和自托管部署,以及与Slack和Linear的集成等。AI模型LangSmith Engine性能提升问题检测5 个信源在谈事件专题推荐理由:LangSmith Engine性能大幅提升,功能丰富,对于需要高效问题检测和修复的企业来说是个不错的选择。原文稍后读已读值得跟进有用关注 LangSmith Engine
02:04lmarena.ai@lmarena_ai78°Alibaba_Qwen的Qwen3.8-27B模型在图像到WebDev领域排名首位,参数量27B,性能与2.8T参数的Kimi K3相当,价格为每M输入/输出令牌0.40/3美元,支持262K原生上下文,可扩展至1M令牌。同时,Qwen3.8-2.4T-A95B(Max级)的开放权重也已发布。AI模型Qwen3.8-27B智能体多模态1 个信源在谈事件专题推荐理由:Alibaba_Qwen发布了Qwen3.8-27B,性能卓越,价格亲民,是构建应用和智能体的理想选择。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
23:43官方账号Greg Brockman@gdb88°OpenAI发布其首款定制推理芯片Jalapeño的性能数据,在InferenceX基准测试中,Jalapeño在每千瓦峰值吞吐量和token延迟方面均优于商用系统。AI在芯片开发中发挥了直接作用,帮助团队在九个月内完成从设计到tapeout,并优化了算术电路。Jalapeño预计将在年底前部署到OpenAI的计算基础设施中。AI模型OpenAIJalapeño推理芯片10 个信源在谈事件专题推荐理由:OpenAI的Jalapeño芯片在性能上超越了商用系统,AI在开发过程中发挥了关键作用,值得关注其未来的部署和应用。原文稍后读已读值得跟进有用关注 OpenAI
23:35elvis@omarsar0精选Prime Agent 是一款开源的自我改进工具,适用于长期目标智能体工作。它通过持续的记忆和技能传递,使模型在每次运行中不断进步。ARC-AGI-3 RHAE 在最佳移动方面从30%提升到95.5%,并在长上下文编码、GPU内核生成和自主nanoGPT速度竞赛中与原生工具相匹配或超越。技巧Prime Agent自我改进工具ARC-AGI-3 RHAE1 个信源在谈事件专题推荐理由:Prime Agent 是一款非常有趣的自我改进工具,它能够显著提升模型的性能,值得一试。原文稍后读已读值得跟进有用关注 Prime Agent
23:18The Rundown AI@therundownai91°OpenAI发布其定制AI芯片Jalapeño的基准测试,性能比Nvidia GB200和GB300系统高1.9倍,响应速度提升3.6倍。芯片设计从开始到制造完成历时九个月,预计年底前在OpenAI数据中心运行。AI模型OpenAIJalapeño芯片AI芯片10 个信源在谈事件专题推荐理由:OpenAI发布Jalapeño芯片,性能大幅提升,值得一看!原文稍后读已读值得跟进有用关注 OpenAI
22:58IT之家(博客/媒体)85°OpenAI 在 Hot Chips 大会上公布全新推理系统 Jalapeño,性能超越现有顶尖处理器。Jalapeño 由 OpenAI 与博通共同开发,旨在降低延迟,提高 AI 推理效率。测试显示,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 模型上,每瓦 AI 工作量是对比系统的 1.5 至 1.9 倍,端到端延迟降低 28% 至 59%。OpenAI 计划今年底前小规模部署,2027 年逐步扩大。AI模型OpenAIJalapeño 芯片英伟达 GB30010 个信源在谈事件专题推荐理由:OpenAI 的 Jalapeño 芯片性能强劲,挑战英伟达 GB300,值得行业关注。原文稍后读已读值得跟进有用关注 OpenAI
22:40官方一手Apple: Newsroom@Apple NewsroomApple在Mac mini中引入M6,在Mac Studio中引入M5 Ultra,带来性能和AI能力的显著提升。AI产品AppleM6M5 Ultra2 个信源在谈事件专题推荐理由:苹果新推出的M6和M5 Ultra,性能大幅提升,AI计算能力更强,值得一看。原文稍后读已读值得跟进有用关注 Apple
21:50小互@imxiaohu78°M6多线程CPU性能最高达M5的1.2倍、M1的2.4倍;Mac mini搭载M6,CPU性能提升40%,图形性能提升2倍,AI性能提升4倍。AI产品苹果M6CPU性能推荐理由:苹果发布M6,性能大幅提升,比M5和M1更强大!原文稍后读已读值得跟进有用关注 苹果
21:33IT之家(博客/媒体)苹果发布全新 Mac mini,搭载 M6 或 M5 Pro 芯片,性能显著升级。M6 芯片提升 AI 性能 4 倍,M5 Pro 芯片提供专业性能。价格 6999 元起,教育版 6199 元起。支持 Wi-Fi 7、蓝牙 6 和 2.5 Gb 以太网接口。AI产品Mac miniM6 芯片M5 Pro 芯片推荐理由:苹果发布新款 Mac mini,搭载 M6 或 M5 Pro 芯片,性能大幅提升,价格亲民,适合日常办公和 AI 工作流。原文稍后读已读值得跟进有用关注 Mac mini
21:13IT之家(博客/媒体)78°高通发布全新骁龙8系旗舰移动平台,Oryon CPU最高主频达5GHz,引入FlexCache缓存架构,称其为全球最快移动CPU。新CPU支持智能体AI、游戏体验和多任务处理等应用场景,缓存设计优化性能表现。AI产品高通骁龙8系CPU技术FlexCache缓存架构推荐理由:高通骁龙8系旗舰平台CPU技术升级,性能大幅提升,值得关注。原文稍后读已读值得跟进有用关注 高通骁龙8系
10:43官方账号arXiv cs.AI@Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao LiSRPO是一种框架,使LLMs能够分析自身轨迹,将错误合成简洁的'反思补丁',并使用条件教师分数作为密集的token级训练信号。在数学推理和长期代理基准测试中,SRPO实现了最先进的性能,使用Qwen3-8B基模型,在AIME'24上达到73.3%,仅使用8%的训练FLOPs,同时显著提高WebShop(64.7%)、ALFWorld(76.8%)和SWE-Bench-Lite(31.2%)的成功率。论文自反策略优化长期推理LLM推荐理由:SRPO框架使LLMs能够自我分析,提高长期推理能力,比传统方法更高效。原文稍后读已读值得跟进有用关注 自反策略优化
09:38Fireworks AI@FireworksAI_HQFireworksAI将于8月25日与LangChain联合举办工作坊,学习构建LangSmith的定制评估模型并扩展可观察性堆栈以提升性能,随后还有屋顶欢聚时光。AI模型FireworksAILangChain工作坊推荐理由:明天就有FireworksAI和LangChain的工作坊,学习如何构建评估模型,提升性能,还有欢聚活动,不容错过!原文稍后读已读值得跟进有用关注 FireworksAI
06:58IT之家(博客/媒体)iOS 27 版 Safari 引入 Apple Intelligence 自动整理标签页,支持 AI 创建自定义扩展,监测网站变化并提醒,自动更新密码,新增家长控制功能,性能与能效提升。AI产品苹果 SafariAI 整理标签页自定义扩展推荐理由:苹果 Safari 浏览器新升级,AI 功能强大,标签页管理更智能,扩展定制更便捷,家长控制更安心,值得一试!原文稍后读已读值得跟进有用关注 苹果 Safari
04:38lmarena.ai@lmarena_ai78°OpenAI最新定价下,GPT-5.6 Sol和Luna在Agent Arena的多个类别中重塑了Pareto前沿。GPT-5.6 Sol价格下降20%,在工作和代码类别中提升。GPT-5.6 Luna(xHigh)在整体和三个类别(代码、聊天和工作)中均达到Pareto前沿。OpenAI将GPT-5.6 Sol的API和信用定价降低20%,为期3个月。AI模型GPT-5.6 SolOpenAIPareto前沿10 个信源在谈事件专题推荐理由:OpenAI降低了GPT-5.6 Sol的API和信用定价,使其在价格和性能上更具竞争力,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:07Browser Use@browser_use@NousResearch的Hermes浏览器任务因使用旧版工具而缓慢,更新到最新版Browser Use 3.0 CLI后速度提升72%。建议检查并更新配置,重启以体验速度提升。AI产品Browser Use CLIHermes代理性能提升推荐理由:更新到最新版的Browser Use CLI,让你的Hermes代理性能提升10倍,速度提升显著!原文稍后读已读值得跟进有用关注 Browser Use CLI
21:30IT之家(博客/媒体)小米发布首款AI旗舰SoC玄戒O3,支持LPDDR6内存,长鑫存储为核心合作伙伴。LPDDR6内存速率达10667Mbps,带宽提升48%。这是国产LPDDR6芯片首次在旗舰级处理器芯片上应用。AI产品小米玄戒O3LPDDR6内存长鑫存储推荐理由:小米玄戒O3首发LPDDR6内存,性能提升显著,值得关注。原文稍后读已读值得跟进有用关注 小米玄戒O3
21:14IT之家(博客/媒体)71°小米宣布9月为科技大月,将发布澎程系列新车和Xiaomi 18 Pro/Fold旗舰手机,搭载玄戒O3 AI旗舰处理器,性能大幅提升。AI产品小米玄戒O3旗舰手机推荐理由:小米9月发布新旗舰芯片和手机,性能提升显著,值得关注。原文稍后读已读值得跟进有用关注 小米
16:03IT之家(博客/媒体)小米发布新一代玄戒芯片,包括玄戒 O3、O100 和 D100,玄戒 O3 芯片内部刻有“OK”手势,寓意“万事 OK”。玄戒 O3 是小米最高端产品的 AI 旗舰 SoC,性能大幅提升。AI产品小米玄戒 O3芯片AI 旗舰 SoC推荐理由:小米工程师在玄戒 O3 芯片内部刻有“OK”手势,寓意“万事 OK”,这种工程师的浪漫值得一看。原文稍后读已读值得跟进有用关注 小米玄戒 O3
14:58IT之家(博客/媒体)小米平板9ProMax将搭载玄戒O3AI旗舰处理器,9月发布。玄戒O3是首个突破安兔兔跑分500万的旗舰SoC,CPU采用十核全大核设计,GPU首发16核G2-Ultra NX图形处理器,支持第三代光线追踪。芯片NPU架构全面重构,专为XiaomiMiMo端侧大模型而生,端侧AI性能大幅提升45%AI产品小米平板9ProMax玄戒O3芯片AI旗舰处理器推荐理由:小米平板9ProMax即将发布,搭载性能强大的玄戒O3芯片,是小米最强的专业生产力平板,值得期待!原文稍后读已读值得跟进有用关注 小米平板9ProMax
14:38IT之家(博客/媒体)小米玄戒 O3 正式发布,安兔兔跑分 522 万分,CPU 十核全大核设计,GPU 16 核 G2-Ultra NX,支持 LPDDR6,NPU 架构重构,搭载第五代旗舰 ISP 架构,通过安全认证,全模块 All in AI。AI产品小米玄戒 O3旗舰 SoC性能提升推荐理由:小米玄戒 O3 发布,性能强劲,跑分突破 500 万分,AI 体验全面升级,值得关注。原文稍后读已读值得跟进有用关注 小米玄戒 O3
14:28IT之家(博客/媒体)小米玄戒 O3 芯片发布,采用十核全大核 CPU 设计,GPU 首发 G2-Ultra NX 图形处理器,性能提升 60%,功耗降低 64%,支持 LPDDR6,端侧 AI 性能提升 45%。AI产品小米玄戒 O3 芯片CPU 设计G2-Ultra NX推荐理由:小米最新发布的玄戒 O3 芯片,性能大幅提升,GPU 首发 G2-Ultra NX,是手机芯片的一大进步,值得关注。原文稍后读已读值得跟进有用关注 小米玄戒 O3 芯片
13:23量子位@量子位的朋友们精选WRC 2026大会发布原生全模态世界模型,支持多模态交互;模型基于大规模数据训练,性能优于现有模型;模型可用于模拟世界交互,拓展AI应用场景。AI模型WRC 2026全模态世界模型多模态交互推荐理由:WRC 2026发布原生全模态世界模型,交互性强,性能卓越,拓展AI应用边界。原文稍后读已读值得跟进有用关注 WRC 2026
11:58IT之家(博客/媒体)上汽 MG 07 将 OTA 升级 Momenta R7 世界模型,解锁车位到车位、行车漫游等自动能力,性能指标提升数倍。搭载 Momenta 强化学习大模型与新芯航途 XHEART X7 大模型专用芯片。售价 10.59 万元 ~15.69 万元,纯电续航 845km。AI产品上汽 MG 07Momenta R7自动驾驶推荐理由:上汽 MG 07 升级后性能大幅提升,自动驾驶能力增强,性价比高,值得关注。原文稍后读已读值得跟进有用关注 上汽 MG 07
02:33Suhail@Suhail中国推理层新模型补贴显著提升与Anthropic/OpenAI竞争的新智能体编码产品性能。5轮迭代,3次优化,29次点赞,2639次浏览,8次点赞。AI模型智能体推理模型补贴10 个信源在谈事件专题推荐理由:中国新补贴让智能体编码产品性能大增,比OpenAI还强!原文稍后读已读值得跟进有用关注 智能体
01:18elvis@omarsar0精选本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。论文AI智能体最优提问上下文获取推荐理由:这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。原文稍后读已读值得跟进有用关注 AI智能体
03:53techcrunch@Julie BortNvidia研究显示,即使AI模型在任务上表现不佳,通过微调,AI智能体仍能良好表现,不会失控。AI模型NvidiaAI智能体微调3 个信源在谈事件专题推荐理由:Nvidia展示了AI模型之外的另一个关键因素——harness,它对AI性能至关重要。原文稍后读已读值得跟进有用关注 Nvidia
22:04elvis@omarsar078°DeepSeek-V4-Flash-Vision-Exp模型发布,在多模态任务中表现优异,接近Opus-4.8水平。DeepSeek Harness 0.1.1支持新模型。AI模型DeepSeek-V4-Flash-Vision-Exp多模态模型性能提升4 个信源在谈事件专题推荐理由:DeepSeek新模型DeepSeek-V4-Flash-Vision-Exp发布,性能接近Opus-4.8,值得尝试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-Vision-Exp
10:56官方账号arXiv cs.LG@Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko YamasakiTask-CoEvolve通过自适应验证任务选择,实现高效LLM智能体 Harness 优化,降低评估成本,提高性能。在在线文本分类和Terminal-Bench 2.1实验中,Task-CoEvolve比固定子集基线表现更优,且优化过程中评估次数减少80%。代码将在GitHub发布。论文Task-CoEvolveLLM智能体优化推荐理由:Task-CoEvolve通过自适应任务选择优化LLM智能体,比传统方法更高效,值得一看。原文稍后读已读值得跟进有用关注 Task-CoEvolve