08:10Latent.Space@latentspacepod精选72°Axiom Math AI 创始人兼 CEO Carina Hong 在播客中解释,数学验证可能是从代码智能体迈向 AGI 的关键。她认为,通过 Lean 等形式化证明工具,可以将推理转化为更强的奖励信号,从而扩展 AI 的“聪明”而非仅仅修复幻觉。Axiom 将市场定位为所有 AI 生成的代码,并强调未来 AI 的瓶颈可能不是生成,而是验证。该方法还能以自验证方式证明研究猜想。AI模型Axiom数学验证AGI推荐理由:数学验证正在成为 AI 推理的下一个突破口,做代码智能体或形式化验证的开发者值得关注——这可能是从“生成”到“验证”的范式转变。原文稍后读已读值得跟进有用关注 Axiom
06:06Sundar Pichai@sundarpichai88°Google CEO Sundar Pichai 宣布推出 Gemma 4 12B 模型,该模型在体积和性能之间取得平衡,可在配备 16GB VRAM 的笔记本电脑上本地运行。它支持多步推理和智能体工作流,采用 Apache 2.0 开源许可。同时,Gemma 4 系列下载量已超过 1.5 亿次。该模型为开发者提供了在本地设备上部署强大 AI 能力的新选择。AI模型Gemma 412B本地运行10 个信源在谈事件专题推荐理由:对于想在笔记本上跑本地 AI 的开发者,Gemma 4 12B 是难得的小体积高性能选择,16GB VRAM 就能运行,建议直接下载试试。原文稍后读已读值得跟进有用关注 Gemma 4
00:31官方账号阶跃星辰 Stepfun@Stepfun_AIStep 3.7 Flash 模型专为真实世界的智能体编程任务设计,不仅追求代码生成速度,更注重在复杂输出中保持逻辑、视觉和执行的一致性。该模型在演示中展示了其在多步骤、多模态任务中的连贯性,适合需要高可靠性的编程场景。开发者 @atomic_chat_hq 的创意测试进一步验证了其能力。AI模型智能体编程助手推理模型推荐理由:做智能体编程的开发者终于有了一个兼顾速度和一致性的模型——Step 3.7 Flash 在复杂任务中保持逻辑连贯,值得在真实项目中试试。原文稍后读已读值得跟进有用关注 智能体
19:16官方账号Decoder@Maximilian Schreiner83°在Build 2026大会上,微软发布了7款自研AI模型,包括其首个推理模型。微软还推出了一种新的调优方法和一个自主后台智能体。在图像生成方面,微软声称超越了谷歌,但在推理能力上仍在追赶。这些模型和工具旨在增强Azure AI平台,为开发者提供更强大的AI构建能力。微软的自主后台智能体可以自动执行后台任务,提高效率。AI产品微软自研模型图像生成推荐理由:微软一口气推出7款自研模型,图像生成能力超越谷歌,但推理模型仍在追赶——做AI应用开发的团队值得关注这些新工具,尤其是新的调优方法和自主后台智能体,可以直接提升项目效率。原文稍后读已读值得跟进有用关注 微软
13:48Mustafa Suleyman@mustafasuleyman88°微软CEO Mustafa Suleyman宣布推出7款全新MAI系列模型,包括文本基础模型MAI-Thinking-1、图像模型MAI-Image-2.5及高效编程模型MAI-Code-1-Flash。MAI-Thinking-1拥有350亿激活参数的MoE架构,256K上下文窗口,在AIME 2025上达到97%,SWE Bench Pro上53%,与Opus 4.6持平,且盲测中整体质量优于Sonnet 4.6。该模型针对微软自研MAIA 200芯片优化,性能每美元提升30%,每瓦性能提升1.4倍。MAI-Code-1-Flash仅5B参数,SWE Bench Pro达51%,成本更低。微软还推出Frontier Tuning服务,允许企业定制专属模型,早期案例中为McKinsey定制模型以10倍低成本超越GPT-5.5。AI模型MAI-Thinking-1MAI-Code-1-FlashMAI-Image-2.55 个信源在谈事件专题推荐理由:微软一口气推出7款新模型,覆盖推理、编程、图像三大方向,MAI-Thinking-1在推理和编码上直接对标Claude Sonnet 4.6和Opus 4.6,做AI应用或企业定制化模型的团队值得关注——尤其是Frontier Tuning让企业用更低成本获得超越GPT-5.5的效果。原文稍后读已读值得跟进有用关注 MAI-Thinking-1
10:47官方账号arXiv cs.AI@Areeb Gani, Asal Meskin, Gabrielle Kaili-May Liu, Arman Cohan精选该研究提出一个系统框架,用于量化大型推理模型(LRM)在输出长链思维时,其内在置信度与语言表达置信度之间的对齐程度(即忠实校准FC)。研究发现,LRM的推理行为并不会自动提升FC,且针对非推理模型的提示干预在推理场景中无效。不同置信度估计器对同一推理轨迹给出分歧评估,暴露了现有评估方法的脆弱性。这项工作将FC确立为LRM在高风险部署场景下的关键可靠性与对齐目标。论文推理模型置信度校准模型对齐推荐理由:LRM的推理链常被用户视为深思熟虑的证据,但这项研究戳破了这个幻觉——推理行为并不等于置信度表达更可靠。做模型对齐或安全评估的团队值得关注,尤其是那些在医疗、金融等高风险场景部署LRM的开发者,看完会重新审视你的置信度校准策略。原文稍后读已读值得跟进有用关注 推理模型
10:47官方账号arXiv cs.AI@Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang精选现有基于评分标准的强化学习(RL)方法将查询分布视为固定,导致开放查询产生模糊评分标准,而狭窄查询又引入无法验证的参考,使训练失去奖励信号。QUBRIC框架通过教师提取关键点将开放查询重写为可评估的场景问题,并利用对比评分生成和可学习性过滤,保留信息丰富的查询-评分对用于GRPO训练。在ArenaHard上,QUBRIC相比SFT基线提升5.5分,且仅用指令跟随数据训练后,在三个未见基准(法律、道德、叙事推理)上平均提升6.3分。这表明联合设计查询与评分标准可使基于评分标准的RL成为严格可验证任务之外的有效补充。论文强化学习评分标准查询设计推荐理由:QUBRIC解决了RL在非可验证任务中的核心瓶颈——查询与评分标准不匹配,做RL训练或AI对齐的团队可以直接参考其方法,提升模型在开放推理任务上的表现。原文稍后读已读值得跟进有用关注 强化学习
10:38官方账号arXiv cs.LG@Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu, Chenghao Yang, Jesse Thomason, Robin Jia精选推理模型通过长思维链提升准确性,但长输出导致内存和计算瓶颈。现有KV缓存淘汰方法在压缩缓存时会丢失关键信息,导致模型陷入重复推理循环。研究发现,少量值状态具有异常大的幅度,淘汰它们会引发灾难性失败;引入随机性可提高缓存多样性。基于此,研究者提出VaSE方法,无需训练即可保护大幅度值状态并促进多样化淘汰决策。在6个推理任务上,Qwen3模型使用VaSE实现4倍KV缓存压缩,准确率超过最强淘汰方法4%以上,弥合了效率与准确性之间的差距。论文KV缓存推理模型内存优化推荐理由:推理模型的长输出让内存和计算成本飙升,VaSE用随机淘汰策略在4倍压缩下保持高准确率,做推理模型优化的开发者可以直接参考论文实现。原文稍后读已读值得跟进有用关注 KV缓存
10:32官方一手arXiv: DeepSeek@Ziyan Liu, Xueda Shen, Yuzhe Gu, Songyang Gao, Kuikun Liu, Guangran Cheng, Chengqi Lyu, Dahua Lin, Wenwei Zhang, Kai Chen72°大型推理模型(LRM)在链式思维(CoT)上通过可验证奖励强化学习(RLVR)取得了显著进展,但长CoT中固有的试错和冗余探索被强化,导致过度思考问题。现有方法主要偏向较短轨迹,但学习信号仍基于结果,无法减少长CoT中的冗余记忆。为此,研究者提出ThoughtFold框架,通过细粒度偏好学习来缓解冗余探索,实现高效推理。它采用内省策略识别正确轨迹中的冗余,生成候选子轨迹谱,并引入掩码偏好优化目标,显式惩罚冗余探索,鼓励模型直接连接关键推理段,从而折叠推理链。实验表明,ThoughtFold将DeepSeek-R1-Distill-Qwen-7B的token使用量减少约56%,同时保持最先进的准确性。论文推理模型链式思维偏好学习推荐理由:ThoughtFold解决了LRM过度思考的痛点,做推理模型优化的团队可以直接参考其内省偏好学习方法,能大幅降低计算成本而不牺牲精度。原文稍后读已读值得跟进有用关注 推理模型
10:27官方账号arXiv cs.AI@Yu Xia, Zhouhang Xie, Xin Xu, Byungkyu Kang, Prarit Lamba, Xiang Gao, Julian McAuley精选72°ACTS提出了一种新方法,通过智能体控制器自适应地引导冻结的推理模型,在推理过程中动态调整思考策略和预算,从而在保持生成连续性的同时大幅节省token。该方法将推理引导建模为马尔可夫决策过程,控制器根据推理轨迹和剩余预算发出策略动作。实验表明,ACTS在全思考性能下实现了显著的token节省,并支持不同推理器和任务间的可控精度-效率权衡。代码已开源。论文推理模型token节省智能体推荐理由:ACTS解决了LLM推理中token浪费和缺乏控制的问题,做推理优化或部署大模型的开发者可以直接用开源代码尝试,实现更经济的推理。原文稍后读已读值得跟进有用关注 推理模型
10:15官方账号arXiv cs.AI@Mubarak Adetunji Ojewale精选解耦式LLM推理中,KV缓存需在解码前穿越数据中心网络,导致传输时间直接计入首令牌延迟(TTFT)。现有调度器仅考虑计算负载和前缀缓存局部性,忽略了预填充与解码实例间的拓扑距离和动态拥塞。NetKV通过引入网络成本预言机,证明了忽略网络项会导致缓存感知调度在上下文长度增长时性能任意次优。在64 GPU四层胖树模拟器上,NetKV将平均TTFT降低21.2%,SLO达标率提升20.1个百分点,且每令牌时间开销低于0.5毫秒。该方法无需修改传输层、推理引擎或硬件。论文推理模型KV缓存网络感知调度推荐理由:做大规模LLM推理部署的团队,NetKV直接解决了TTFT瓶颈——网络延迟被正式纳入调度决策,实测效果显著且零侵入,值得在现有集群上评估。原文稍后读已读值得跟进有用关注 推理模型
09:52berryxia@berryxia精选微软AI今日发布了七个全新MAI模型,包括MAI-Thinking-1、MAI-Code-1-Flash、MAI-Image-2.5等,覆盖推理、编码、图像、语音和转录任务。这些模型是从零开始、使用干净数据训练,不依赖蒸馏,强调血统纯净。其中MAI-Code-1-Flash在SWE-Bench Verified上达到71.6分,超越Claude Haiku 4.5,且节省60% token。MAI-Image-2.5在图像编辑和文本生图排名靠前,已集成到PowerPoint和OneDrive。微软的策略是构建专精任务、可协作的模型家族,而非追求单一通用大模型。AI模型微软MAI模型编程助手5 个信源在谈事件专题推荐理由:微软这次反主流而行,用干净数据从零训练专精模型,做AI开发或选型的人值得关注——MAI-Code-1-Flash在编码任务上性价比突出,Copilot用户可以直接体验。原文稍后读已读值得跟进有用关注 微软
08:37Fireworks AI@FireworksAI_HQ微软 MAI 模型即将在 Fireworks 平台上架,提供可控的智能和可追溯的端到端数据链。企业用户可针对自身任务对 MAI 推理模型进行微调,使用自己的数据构建定制化模型。这标志着微软将企业级 AI 能力进一步开放给开发者,Fireworks 作为高性能推理平台,将加速 MAI 模型的落地应用。AI产品微软MAIFireworks推荐理由:企业 AI 团队终于有了可定制的推理模型——MAI 支持端到端数据溯源和私有微调,做企业级 AI 应用的开发者可以直接在 Fireworks 上尝试,省去自建基础设施的麻烦。原文稍后读已读值得跟进有用关注 微软
08:12lmarena.ai@lmarena_ai精选76°微软在Build大会上发布了七款全新的MAI系列模型,涵盖推理、代码、图像、转录和语音等能力。这些模型从零开始训练,基于干净的数据溯源,设计注重效率,并作为模型家族无缝协作。其中MAI-Image-2.5是图像生成模型,其他模型包括推理、代码生成、语音识别等。这标志着微软在自研AI模型上的重大投入,旨在为开发者提供一体化AI解决方案。AI模型微软MAI模型Build大会5 个信源在谈事件专题推荐理由:微软一口气推出七款自研模型,覆盖推理到语音全场景,做AI应用开发的团队可以直接集成,省去拼凑多家模型的麻烦。原文稍后读已读值得跟进有用关注 微软
06:32官方账号Simon Willison’s Weblog(博客/媒体)76°微软今日发布两款新文本 LLM:MAI-Thinking-1(35B 参数,推理模型,面向早期合作伙伴)和 MAI-Code-1-Flash(5B 参数,专为 GitHub Copilot 和 VS Code 设计,已向个人用户推出)。MAI-Thinking-1 在盲测中优于 Sonnet 4.6,且参数规模较小,运行成本更低。两款模型均使用清洁、商业授权数据从头训练,未蒸馏第三方模型,也未使用未授权的网络数据。这标志着微软在低成本、合规数据训练的高效模型上迈出重要一步。AI模型微软MAI-Thinking-1MAI-Code-1-Flash推荐理由:微软用 35B 参数模型挑战 Sonnet 4.6,证明小模型也能出奇迹——做推理应用或 Copilot 开发的团队值得关注,尤其是对数据合规有要求的项目。原文稍后读已读值得跟进有用关注 微软
05:02rohanpaul_ai@rohanpaul_ai88°微软发布了 MAI-Thinking-1,这是其自研推理模型系列的首个成果。该模型采用 1T 总参数的混合专家架构,每次推理仅激活 35B 参数,在 AIME 2025 上达到 97.0%,LiveCodeBench v6 上 87.7%,SWE-Bench Pro 上 52.8%。微软称其训练流程为“爬山机器”,通过持续优化数据、训练、奖励和安全测试形成闭环。预训练基于 30T 主要人工生成 token,避免使用第三方模型蒸馏,随后通过强化学习提升数学、编程、工具使用和安全能力。这标志着微软在推理模型领域建立了完整的自研能力。AI模型推理模型微软MAI-Thinking-1推荐理由:微软用自研数据+强化学习打造了强推理模型,做 AI 推理或模型训练的团队值得关注其“爬山机器”方法论,尤其是 35B 激活参数就能达到接近顶尖水平的效率。原文稍后读已读值得跟进有用关注 推理模型
02:26IT之家(博客/媒体)83°微软在 Build 2026 大会上发布自研 AI 模型系列,包括首款高级推理模型 MAI-Thinking-1。该模型为中等规模,在软件工程基准测试中达到业界领先水平,并承诺完全自研、未使用第三方蒸馏数据。同时发布的还有图像生成模型 MAI-Image 2.5、语音转写模型 MAI-Transcribe-1.5(速度达竞品五倍)、语音合成模型 MAI-Voice-2 及编程辅助模型 MAI-Code-1。MAI-Code-1 已集成到 GitHub Copilot 和 VS Code 中。这标志着微软在推理、图像、语音和编程等 AI 领域全面布局自研模型。AI模型推理模型微软MAI-Thinking-1推荐理由:微软终于拿出了自己的推理模型,而且强调纯自研、不蒸馏,这对关注模型自主可控的开发者是个信号。做软件工程或编程的团队可以关注 MAI-Code-1 在 Copilot 中的实际表现,值得一试。原文稍后读已读值得跟进有用关注 推理模型
01:20官方账号LangChain@LangChainAILangChain 创始人 Harrison Chase 在 X 上发布视频,用 1 分钟解释了 Managed Deep Agents 的概念。Managed Deep Agents 是一种新型智能体架构,通过将深度推理与受控管理结合,提升复杂任务执行的可靠性和效率。该架构旨在解决传统智能体在长链推理中容易出错的问题,适合需要高精度决策的自动化场景。视频发布后引发社区关注,已有 7000 多次浏览。AI产品智能体LangChain推理模型推荐理由:LangChain 创始人亲自拆解 Managed Deep Agents 架构,做智能体开发的团队值得花 1 分钟理解这个新范式,能帮你避开长链推理的坑。原文稍后读已读值得跟进有用关注 智能体
01:14OpenRouter@OpenRouterAIDigitalOcean 的 AI-Native Cloud 现已作为新供应商接入 OpenRouter 平台,提供高性能推理服务。该服务支持多种热门开源模型,在 DeepSeek V3.2 模型上输出速度和延迟均排名第一,数据由 Artificial Analysis 验证。开发者可通过 OpenRouter 直接调用这些模型,获得更快的响应体验。AI产品DigitalOceanOpenRouter推理模型推荐理由:做 AI 应用开发或需要快速推理的团队,现在可以在 OpenRouter 上直接使用 DigitalOcean 的高性能云服务,DeepSeek V3.2 的速度优势值得一试。原文稍后读已读值得跟进有用关注 DigitalOcean
22:55官方账号阶跃星辰 Stepfun@Stepfun_AIStep 3.7 Flash 是一款面向快速智能体编码的开源权重模型,支持可靠工具调用和多模态理解。该模型已从模型卡片阶段进入实际编码工作流,由 @kilocode 团队在博客中详细介绍。其设计重点在于提升智能体编码效率,适合开发者集成到自动化编程任务中。这一进展标志着开源模型在实用化方面迈出重要一步。AI模型开源/仓库推理模型编程助手推荐理由:做智能体编码的开发者终于有了一个可直接使用的开源模型——Step 3.7 Flash 的可靠工具调用和多模态能力能显著提升自动化效率,建议点开博客了解具体集成方式。原文稍后读已读值得跟进有用关注 开源/仓库
19:21Ate-a-Pi@svpino一个创新的AI推理市场概念被提出,它能够根据实时价格将请求路由到最便宜的合格模型。目前用户通常按固定费率支付给供应商,但这种方式即将改变。该市场声称可节省高达87%的推理成本。这一想法旨在打破固定定价模式,让AI推理更经济高效。AI产品推理模型成本优化市场/平台推荐理由:做AI推理的团队终于有了降本利器——动态路由到最便宜模型,直接省87%成本,做模型部署和成本优化的建议点开看看。原文稍后读已读值得跟进有用关注 推理模型
12:04官方账号arXiv cs.AI@Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee推理语言模型在复杂推理任务上表现优异,但在非英语输入上仍存在多语言推理差距,主要原因是语言理解失败。英语翻译可以缓解这一问题,但并非所有输入都需要翻译。为此,研究者提出 Luar(语言理解边界感知强化学习框架),训练模型在直接理解不可靠时选择性调用翻译。在多项多语言推理基准测试中,Luar 优于标准 GRPO 等方法,尤其在低资源语言上提升显著。该框架能避免不必要的翻译,并泛化到未见过的低资源语言。项目代码已开源。论文推理模型多语言强化学习推荐理由:多语言推理场景下,翻译不是越多越好——Luar 教会模型在「不懂的时候才翻」,做多语言 NLP 或低资源语言应用的团队可以直接用这个框架来提升推理效率。原文稍后读已读值得跟进有用关注 推理模型
11:17官方账号arXiv cs.LG@Ting Xu, Xu He, Yupu Lu, Jiankai Sun, Dong Li, Wai Lam, Jianye Hao精选72°这篇论文研究了链式推理(CoT)过程中的熵变化,发现了一个一致的两阶段结构:先是不确定性探索阶段,然后突然过渡到置信收敛阶段。置信阶段具有高可靠性和高冗余性两个关键特性,模型在得出正确答案后仍会生成大量无用token。基于此,作者提出了两种更高效的推理策略:早退机制(Early Exit)和测试时缩放(Test-Time Scaling)。他们使用累积和(CUSUM)算法进行实时推理控制,无需额外训练。实验表明,CUSUM早退在准确率63.06%时实现了11.1%的token缩减,优于DEER和Dynasor。论文推理模型CoT/链式推理早退机制推荐理由:这篇论文揭示了CoT推理中隐藏的熵动力学规律,做推理加速和模型效率优化的研究者可以直接用CUSUM方法实现无训练早退,比现有方法更优。原文稍后读已读值得跟进有用关注 推理模型
11:10官方账号arXiv cs.AI@Ekaterina Alimaskina, Darya Rudas, Denis Shveykin, Gleb Molodtsov, Pavel Vasiliev, Aleksandr Beznosikov精选72°该研究揭示了大型推理模型在极端低比特(2-bit)量化推理时,并非单纯降低答案准确率,而是产生更长的推理轨迹,包括重复循环、预算耗尽、延迟决策和未闭合推理段,导致端到端速度不升反降。作者针对 Qwen3-8B 和 Qwen3-32B 模型,提出了两种轻量级控制方法:FP16 规划(为 2-bit 模型提供短的高精度大纲)和循环救援(检测重复轨迹并回退或提前提交答案)。在 MATH-500 上,循环救援将 Qwen3-8B 准确率从 17.2% 提升至 74.2%,规划加循环救援将 Qwen3-32B 从 65.0% 提升至 87.2%。研究表明,将低比特推理失败视为可控生成病理,通过轻量检测和选择性 FP16 支持,2-bit 推理可以恢复准确率并保持真实端到端加速。代码已开源。论文推理模型量化/低比特Qwen3推荐理由:做推理模型量化和部署的团队终于有了针对 2-bit 失败模式的系统解法——不是简单降精度,而是用 FP16 规划和循环救援来修复生成过程,Qwen3 用户可以直接复现并提升准确率。原文稍后读已读值得跟进有用关注 推理模型
11:08官方账号arXiv cs.AI@Xiang Li, Jiwei Wei, Ke Liu, Yitong Qin, Jinyu Guo, Malu Zhang, Peng Wang, Yang YangeMoT 提出了一种名为“演化思维记忆”的新框架,将推理轨迹视为动态演化的记忆而非静态模板,以解决大模型在多步推理中的幻觉和数值计算问题。该框架包含三个核心模块:记忆腐蚀机制(强化高效用推理结构并衰减低频结构)、符号锚定引擎(利用 Python 进行确定性计算,类似人类使用计算器)以及一致性驱动精炼过程(对齐神经推理与符号结果,减少逻辑偏差)。在 Game of 24 任务上,eMoT 达到 100% 准确率,比基线提升 17.6%;在 GSM8K、ASDiv、SVAMP 和 MGSM 等数学推理基准上也有持续改进。即使使用轻量级模型,eMoT 也优于依赖大规模模型的方法,表明性能提升主要来自框架的推理控制而非模型规模。论文推理模型记忆机制符号锚定推荐理由:eMoT 解决了大模型在多步推理中容易出错和产生幻觉的痛点,做推理增强或数学推理的开发者可以直接参考其记忆腐蚀和符号锚定机制,值得一试。原文稍后读已读值得跟进有用关注 推理模型
10:36Skywork@Skywork_ai88°Anthropic 最新模型 Claude Opus 4.8 已在 Skywork 平台上线。该模型在判断力和推理能力上有显著提升,能够处理更复杂的任务。Skywork 用户现在可以直接使用该模型进行对话和推理。这标志着 Anthropic 在 AI 模型能力上的持续进步。AI模型Claude Opus 4.8推理模型Skywork10 个信源在谈事件专题推荐理由:Claude Opus 4.8 的更强推理能力对需要高精度判断的开发者(如代码审查、逻辑分析)是直接利好,Skywork 用户现在就能体验,建议试试。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
10:17AI Will@FinanceYF5一款语音Agent现在具备了GPT-5级别的推理能力,能够在说话的同时进行实时思考,实现了真正的智能交互。这一突破意味着语音助手不再只是简单响应指令,而是能像人类一样边思考边表达,大幅提升对话的自然度和深度。该进展可能改变语音交互的应用场景,从客服到个人助理都将受益。AI产品语音Agent推理模型GPT-5推荐理由:语音Agent终于能边说话边推理了,做语音交互或智能客服的团队值得关注,这可能是体验质变的关键一步。原文稍后读已读值得跟进有用关注 语音Agent
10:10Gary Marcus@GaryMarcus精选Gary Marcus 转发了一条关于神经符号系统(Neurosymbolic)的突破性进展:通过让一个 80 万参数的 Transformer 像逻辑求解器一样推理,仅用 15 分钟训练计算就能在极难数独(sudoku-extreme)上达到 100% 准确率。这项工作由 Leo 在 Axiom Math AI 完成,标志着神经符号集成在推理任务上的重大进步。它展示了小模型通过符号化推理能力可以超越纯神经网络方法,为 AI 推理效率提供了新思路。论文神经符号系统推理模型Transformer推荐理由:神经符号系统终于有了可量化的突破——小模型+符号推理就能碾压纯神经网络,做推理模型和逻辑 AI 的团队值得关注这个方向。原文稍后读已读值得跟进有用关注 神经符号系统
08:44IT之家(博客/媒体)88°微软将在 Build 2026 大会上发布其首个自研推理 AI 模型 MAI-Thinking-1,该模型完全自研,未使用其他模型输出蒸馏训练。同时,微软还将推出 MAI-Image-2.5 和 MAI-Image-2.5-Flash 生图模型,补齐自有模型组合。此外,一张所谓的 Copilot“超级应用”截图曝光,显示多个 AI 助手整合在一起,并出现 Scout AI agent,但消息源称该截图仅为模型图,测试版要到夏末才发布。这标志着微软在 AI 自研模型和 Copilot 生态上的重要进展。AI产品推理模型微软MAI-Thinking-15 个信源在谈事件专题推荐理由:微软终于推出自研推理模型,不再依赖 OpenAI,做 AI 应用开发的团队可以关注其性能表现;Copilot 超级应用整合多个 AI 助手,使用微软生态的开发者值得提前了解。原文稍后读已读值得跟进有用关注 推理模型
00:17Paul Couvert@itsPaulAi83°MiniMax 发布开源权重模型 M3,在 SWE-Bench Pro 上达到 59.0%,与 GPT-5.5 持平,并在多项编码基准上与 Opus 4.7 不相上下。M3 还支持 1M 上下文、原生多模态,使用成本仅为 GPT 和 Opus 的十分之一。权重和技术报告将在约 10 天后在 Hugging Face 开放。这标志着开源模型首次在多个前沿能力上追平闭源顶级模型,对 AI 开发者和企业用户意义重大。AI模型开源/仓库推理模型编程助手推荐理由:开源模型首次在编码和智能体任务上追平 GPT-5.5 和 Opus,成本却低一个数量级。做 AI 应用开发或自建模型的团队,值得关注权重发布后直接试用。原文稍后读已读值得跟进有用关注 开源/仓库
12:35官方账号NVIDIA AI@NVIDIAAI精选NVIDIA AI 官方推特宣布,新一代大语言模型 Nemotron 3 Ultra 将于本周内推出。这是 Nemotron 系列的最新版本,具体参数和性能细节尚未披露。此前 Nemotron 4 340B 以推理基准上的表现受到关注,业界期待新版本能否进一步在效率和准确性上提升。AI模型Nemotron 3 UltraNVIDIA开源模型7 个信源在谈事件专题推荐理由:NVIDIA 终于要发新模型了原文稍后读已读值得跟进有用关注 Nemotron 3 Ultra
11:16官方账号Together AI@togethercompute精选MiniMax 的最新模型 M3 已正式上线,并由 Together AI 提供推理基础设施支持。双方将于明天太平洋时间下午6点在 X Spaces 进行深度对话,分享模型和基础设施的细节。这一合作意味着 M3 模型将获得高性能的推理服务,对开发者来说是一个值得关注的进展。AI模型MiniMaxM3Together AI推荐理由:MiniMax M3 上线并由 Together AI 支持推理,意味着模型推理性能有保障,做 AI 应用开发的团队可以直接试用,值得关注。原文稍后读已读值得跟进有用关注 MiniMax
10:45官方账号arXiv cs.AI@Liwei Kang, Yee Whye Teh, Wee Sun Lee精选该论文研究了大型语言模型(LLM)在推理过程中如何利用搜索历史。作者发现,LLM通常将搜索树线性化为中间轨迹,但仅凭隐式表示的历史不足以超越传统启发式搜索。通过引入显式的父指针(LinTree结构),模型能更清晰地回溯和切换分支,从而在Blocks World、网格导航和Sokoban等任务中显著提升性能和搜索效率。这表明,显式化搜索树的树结构能更好地发挥历史信息的优势,为LLM推理提供更结构化的表示方法。论文推理模型搜索树LLM推理推荐理由:如果你在做LLM推理或搜索增强的AI系统,这篇论文指出了隐式搜索历史的瓶颈,并提供了一个简单有效的改进方向——显式父指针。做推理模型或规划算法的开发者值得一看。原文稍后读已读值得跟进有用关注 推理模型
07:55官方账号阶跃星辰 Stepfun@Stepfun_AI精选StepFun 的 Step 3.7 Flash 模型在智能体效率方面取得了新突破,通过优化推理速度和资源占用,显著提升了智能体任务的执行效率。该模型特别适合需要快速响应的自动化场景,如代码生成、数据处理等。开发者可以借助它构建更高效的智能体应用,降低延迟和成本。这一进展为智能体技术的实际落地提供了有力支持。AI模型Step 3.7 Flash智能体效率优化推荐理由:做智能体开发的团队会关注——Step 3.7 Flash 直接解决了效率瓶颈,建议试试看能否优化你的自动化流程。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
10:50宝玉@doteyAI 从业者 dotey 分享了自己的使用原则:优先选择推理能力更强的模型(Reasoning Max),而非追求速度(Speed Fast)。他认为慢推理能减少后续验证时间,而快速模型性价比不高。这一观点引发了对 AI 模型选择策略的讨论,尤其适合注重准确性和效率的开发者。技巧推理模型模型选择效率推荐理由:做 AI 应用或模型选型的开发者,这条原则帮你省下反复验证的时间——慢推理反而更快,值得一试。原文稍后读已读值得跟进有用关注 推理模型
05:39官方账号Jeff Dean@JeffDean精选在Logan Kilpatrick主持的对话中,Gemini联合负责人Jeff Dean、Oriol Vinyals、Noam Shazeer和Koray Kavukcuoglu分享了Gemini的当前进展、发展历程及下一步计划。对话未披露具体基准分数或版本号,但涉及模型在多模态和推理能力上的方向。行业GeminiGoogle多模态推荐理由:听Gemini团队聊模型走向原文稍后读已读值得跟进有用关注 Gemini
22:53rohanpaul_ai@rohanpaul_ai72°一场由顶尖研究者参与的 Transformer 与 Post-Transformer 辩论,以拳击擂台形式呈现,兼具技术深度与娱乐性。Transformer 阵营强调其规模化优势、硬件友好性和当前统治地位,认为替代者需 10 倍更好才能迫使生态切换。Post-Transformer 阵营则指出原生推理、持续学习和真正记忆是当前架构的短板,未来可能是混合架构。辩论持续 1 小时 20 分钟,涵盖从注意力机制到 latent reasoning 的多个关键点。AI模型TransformerPost-Transformer推理模型推荐理由:这场辩论把 AI 架构之争讲得既硬核又好玩,做模型研究或关注下一代架构的开发者看完会有新视角,建议直接看原视频。原文稍后读已读值得跟进有用关注 Transformer
17:57AI SDK@aisdkAnthropic 发布了 Claude Opus 4.8,这是 Opus 4.7 的升级版本。新模型在判断力上更加敏锐,对自身进展的表述更诚实,并且能够比前代更长时间地独立工作。该模型现已可用,价格与 Opus 4.7 相同。AI SDK 已支持集成该模型,开发者可以立即使用。AI模型Claude Opus 4.8推理模型AI SDK10 个信源在谈事件专题推荐理由:Claude Opus 4.8 提升了判断力和自主工作能力,做复杂推理和长任务自动化的开发者可以直接用上,价格不变值得升级。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
17:54Dify@dify_aiClaude Opus 4.8 现已集成到 Dify 平台,用户可以在 Dify 中直接调用该模型构建多步骤 AI 工作流。该模型具备更强的推理能力,能自动化复杂任务。Dify 支持连接模型、工具、知识库和工作流逻辑,帮助用户从早期探索过渡到结构化、可复用的工作流。用户可通过 Dify 市场更新使用。AI产品Claude Opus 4.8DifyAI工作流10 个信源在谈事件专题推荐理由:Dify 用户终于能用上 Claude Opus 4.8 的强推理能力来构建多步工作流,做自动化流程的团队可以直接在平台上试,省去模型切换的麻烦。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
14:36官方账号阶跃星辰 Stepfun@Stepfun_AI88°阶跃星辰发布了 Step 3.7 Flash 模型,专注于智能体效率,在 ClawEval-1.1、SimpleVQA Search 等基准测试中取得领先成绩。该模型采用 198B 稀疏 MoE 架构,约 11B 活跃参数,支持 400 TPS 推理速度和 256K 上下文,并提供三种推理级别。它擅长理解 UI、图表、文档和图像,并能直接编写代码或调用工具执行操作,在 τ²-bench 上工具调用可靠性超过 98%。模型权重以 Apache 2.0 开源,可在 Mac Studio M4 Max、DGX Spark 等设备本地运行,并兼容 Claude Code、MCP 等生态。AI模型阶跃星辰Step 3.7 Flash智能体2 个信源在谈事件专题推荐理由:做智能体、编程或搜索应用的开发者终于有了一个兼顾速度、成本和可靠性的开源模型——Step 3.7 Flash 在工具调用和视觉理解上表现突出,而且能在本地跑,建议直接试试。原文稍后读已读值得跟进有用关注 阶跃星辰