12:06官方账号arXiv cs.LG@Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao, Gerald Friedland, Chris Kong精选73°Cliff是一种新的奖励塑造策略,利用现成LLM识别推理过程中的首次错误。该方法将推理分解为正确前缀和错误后缀两部分,并将此信号转换为令牌级优势。在12种不同场景的实验中,Cliff的推理性能表现优异,比在线蒸馏方法提升15%,比标准GRPO提升7%。即使使用能力适中的教师模型,Cliff也能有效提升RLVR的精细监督效果。论文CliffRLVR强化学习推荐理由:研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。原文稍后读已读值得跟进有用关注 Cliff
11:50官方一手arXiv: DeepSeek@Xu Zou, Jie Tang精选73°研究人员提出Trace as State方法,将推理痕迹作为任务状态的文本代理放置在长上下文块之前。在DeepSeek V4 Pro Preview模型上,该方法在GraphWalks Parents任务上将准确率从初始的29.2%提升至81.8%,显著优于Trace Append方法的43.0%。GLM-5.2模型在该任务上实现了100%的准确率。该方法在三种模型和三种长上下文数据集的27种组合中,有26种表现优于对照方法。论文Trace as StateDeepSeek V4 Pro PreviewGLM-5.2推荐理由:DeepSeek和GLM-5.2通过将推理痕迹前置,长上下文推理准确率大幅提升,最高达100%。原文稍后读已读值得跟进有用关注 Trace as State
11:42官方账号arXiv cs.LG@Robin Linzmayer, Noémie Elhadad73°研究分析了大型语言模型在医疗问答中如何受到误导上下文的影响。研究使用了包含8,627个问题的MedMisBench基准测试,评估了三种推理模型对两种误导线索的易感性。模型对断言的采纳率比伪造证据高10-27个百分点。81-98%的推理轨迹中包含了误导线索,但响应中仅披露7-90%。LLM监控器在开放推理轨迹上能以5%的误报率捕获78%的错误决策。论文MedMisBench医疗问答推理模型推荐理由:医疗AI研究团队发现模型对断言比对证据更易受影响,开放推理轨迹能更好检测错误决策。原文稍后读已读值得跟进有用关注 MedMisBench
10:14shao__meng@shao__meng78°Meta AI Research 发布 Muse Spark 1.3,基于大规模用户反馈优化了智能体任务和编码任务。新版本在工程化和落地应用方面有显著提升,工具调用减少约 20%,token 消耗减少约 25%。模型在长程任务处理、主动协作、复杂指令遵循、多任务路由和自我认知校准五个方面进行了针对性改进。AI模型Muse SparkMeta AI智能体推荐理由:Meta 推出了 Muse Spark 1.3,智能体和编码能力大幅提升,成本降低 25%,更适合生产环境使用。原文稍后读已读值得跟进有用关注 Muse Spark
08:48shao__meng@shao__meng78°Gemini 3.8 Flash 在六周内第三次发布,距 3.7 Flash 仅三周。该模型在 Vals Finance Agent v2 达到 61.4%,高于 Opus 5 的 58.6%。Terminal-bench 2.1 得分 89.4%,略高于 Opus 5。在成本效率方面,3.8 Flash 以约 1/7 到 1/8 的任务成本实现了与 Opus 5 几乎相同的通过率。AI模型GeminiGemini 3.8 FlashOpus 510 个信源在谈事件专题推荐理由:Google 发布了 Gemini 3.8 Flash,价格更低但性能接近前沿模型,成本效率大幅提升。原文稍后读已读值得跟进有用关注 Gemini
07:22IT之家(博客/媒体)73°西班牙公司Multiverse Computing发布Quasar 438B模型,拥有4380亿参数,在Intelligence Index v4.1.1评测中得分为43,是欧洲得分最高的模型。该模型在Artificial Analysis Long Context Reasoning评测中得分为75.0,上下文窗口达1M词元,适合处理长文档。Quasar 438B在Terminal-Bench v2.1评测中得分为69.3,API价格为每100万输入词元0.60美元。AI模型Quasar 438BMultiverse Computing推理模型推荐理由:西班牙公司推出欧洲最强AI模型Quasar 438B,1M词元上下文,比Mistral Medium 3.5得分高13。原文稍后读已读值得跟进有用关注 Quasar 438B
04:43官方账号Perplexity@perplexity_aiQwen3.6-35B-A3B 在 M5 Max MacBook Pro 上进行了基准测试。该模型在十种提示长度和十种解码上下文中表现优异。相比 MLX-LM,Qwen3.6-35B-A3B 的预填充吞吐量平均高出 1.23 倍。解码吞吐量平均高出 1.35 倍,同时输出质量基本保持不变。AI模型Qwen3.6-35B-A3BMLX-LMMacBook Pro推荐理由:Qwen3.6-35B-A3B 在苹果笔记本上跑得比 MLX-LM 还快,吞吐量提升超 20%,质量不打折。原文稍后读已读值得跟进有用关注 Qwen3.6-35B-A3B
04:43官方账号Perplexity@perplexity_aiLily将苹果硅视为独特推理平台,直接映射Qwen操作到其计算和内存架构。该项目已在GitHub开源,地址为github.com/perplexityai/p...。Lily专注于优化在苹果设备上的AI模型性能。苹果硅芯片具有独特的计算架构,需要专门优化。AI产品LilyQwen苹果硅推荐理由:Perplexity开源了Lily项目,专门优化Qwen模型在苹果硅芯片上的推理性能。原文稍后读已读值得跟进有用关注 Lily
04:23官方账号Meta AI@AIatMetaMuse Spark 1.3 今日正式上线,可通过 Muse Code 和 Meta Model API 访问。该版本将在完成安全测试后推出最大推理功能。Meta Model API 网址为 dev.meta.ai。AI产品Muse SparkMetaMeta Model API推荐理由:Meta 推出了 Muse Spark 1.3,即将加入最大推理功能,安全测试后上线。原文稍后读已读值得跟进有用关注 Muse Spark
04:22techcrunch@Russell Brandom73°OpenAI发布Astra模型,采用'循环深度'技术。该技术使模型能够突破大多数推理模型的顺序思维限制。安全专家对这一新方法表示担忧。AI模型OpenAIAstra推理模型9 个信源在谈事件专题推荐理由:OpenAI的Astra模型用'循环深度'技术突破顺序思维,安全专家对此表示担忧。原文稍后读已读值得跟进有用关注 OpenAI
03:38Poe@poe_platformGoogle 发布的 Gemini 3.8 Flash 模型现已登陆 Poe 平台。该模型拥有 1M token 上下文窗口,支持网络搜索功能,并具备可调节的思考层级。作为面向编程和智能体的快速高效模型,它在保持 Flash 速度的同时提供了强大的推理能力。AI模型GeminiGemini 3.8 FlashPoe10 个信源在谈事件专题推荐理由:Google 的 Gemini 3.8 Flash 登陆 Poe,速度快成本低,适合编程和智能体任务,还有百万上下文窗口。原文稍后读已读值得跟进有用关注 Gemini
01:35AI SDK@aisdk73°Google发布了Gemini 3.8,这是其最新的推理和编码模型。该模型基于三周前发布的3.7 Flash版本,利用长时间运行的智能体循环技术。新版本包含两个变体:Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。AI产品GeminiGemini 3.8 FlashAI SDK10 个信源在谈事件专题推荐理由:Google刚推出Gemini 3.8 Flash,比三周前的3.7 Flash更强,现在可以用AI SDK直接调用。原文稍后读已读值得跟进有用关注 Gemini
01:13官方账号Decoder@Matthias BastianGoogle在六周内发布第三款Flash模型Gemini 3.8 Flash。该模型在部分智能体编程基准测试中与Claude Opus 5表现相当但成本更低。然而其推理过程消耗约30%更多输出token,实际使用成本高于前代模型。AI模型GeminiClaude Opus 5Google推荐理由:Google六周连推三款经济模型,Gemini 3.8 Flash虽成本低但推理消耗高。原文稍后读已读值得跟进有用关注 Gemini
00:40Paul Couvert@itsPaulAi73°Google发布Gemini 3.8 Flash模型,距离3.7 Flash仅20天。新版本性能与Opus 5和GPT-5.6 Sol相当,但价格仅为前者的1/6和1/5。Google称这是其迄今为止最好的推理和编码模型,包含两个新变体:Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。AI模型GeminiGemini 3.8 FlashGoogle10 个信源在谈事件专题推荐理由:Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。原文稍后读已读值得跟进有用关注 Gemini
00:17OpenRouter@OpenRouterAI78°Gemini 3.8 Flash已在OpenRouter平台上线。该模型以3.7 Flash的 introductory 价格提供。在编码、金融、法律、视频和科学基准测试中均超越前代版本。用户可通过 openrouter.ai/google/gemini- 访问使用。AI模型GeminiGoogleDeepMindOpenRouter推荐理由:GoogleDeepMind刚发布的Gemini 3.8 Flash价格不变但性能全面超越前代,覆盖多个专业领域基准。原文稍后读已读值得跟进有用关注 Gemini
00:15Philipp Schmid@_philschmid73°Google在6周内发布第三个Flash版本,专注于实际工程、长期任务和智能体自主性。Gemini 3.8 Flash在所有领域表现均优于3.7 Flash版本,定价为每100万token 0.75美元/3.75美元。该模型采用更小步骤并更频繁验证工作,虽然会增加token使用量,但能有效提高复杂和长期目标的工作质量。AI模型GeminiGemini 3.8 FlashGoogle10 个信源在谈事件专题推荐理由:Google发布Gemini 3.8 Flash,比前代表现更好,特别适合复杂编程和智能体任务。原文稍后读已读值得跟进有用关注 Gemini
00:14Google Gemini App@GeminiApp73°Google今日发布Gemini 3.8 Flash模型,Pro和Ultra用户可使用。该模型针对日常话题提供可靠全面的建议,并支持文本分析和复杂编码等深度任务。Gemini 3.8 Flash在响应质量和实用性方面有所提升。AI模型GeminiGemini 3.8 FlashGoogle10 个信源在谈事件专题推荐理由:Google发布了Gemini 3.8 Flash,Pro和Ultra用户现在可以用它做文本分析和复杂编程了。原文稍后读已读值得跟进有用关注 Gemini
00:13OpenRouter@OpenRouterAIMiniMax H3 Max 是最新发布的模型,在多个基准测试中表现出色。该模型通过 OpenRouter 平台提供,开发者可以快速接入使用。MiniMax H3 Max 在处理复杂任务时展现出强大的性能。AI模型MiniMaxH3 MaxOpenRouter1 个信源在谈事件专题推荐理由:MiniMax 发布了 H3 Max 模型,在 OpenRouter 上就能用,性能比前代有明显提升。原文稍后读已读值得跟进有用关注 MiniMax
00:13OpenRouter@OpenRouterAIMiniMax H3 Max 模型已在 OpenRouter 平台上线,速度比 H3 快 7 倍,响应时间从 3.5 分钟缩短至约 30 秒。价格方面,H3 Max 每段文本处理费用为 0.4 美元,比 H3 的 0.65 美元更经济实惠。AI模型MiniMaxH3 MaxOpenRouter1 个信源在谈事件专题推荐理由:MiniMax 推出了比 H3 更快更便宜的 H3 Max,在 OpenRouter 上就能用。原文稍后读已读值得跟进有用关注 MiniMax
00:08官方账号Google AI@GoogleAI73°谷歌推出Gemini 3.8 Flash模型,专为处理复杂智能体和多步骤任务设计。该模型在推理能力方面有显著提升,不仅能编写代码还能导航复杂项目。Gemini 3.8 Flash结合原生视频理解和高级编程功能,可自主构建3D游戏、测试并修复错误。模型配备了努力控制机制,确保思考量与消耗的token成正比。AI模型GeminiGemini 3.8 Flash智能体10 个信源在谈事件专题推荐理由:谷歌新发布的Gemini 3.8 Flash能自主完成复杂项目,比前代模型推理能力更强,还支持视频理解与编程的智能体循环。原文稍后读已读值得跟进有用关注 Gemini
00:08Google AI Developers@googleaidevsGoogle 发布了 Gemini 3.8 Flash 模型,该模型专为复杂推理任务设计。研究人员使用该模型与 ThreeJS 在 Google AI Studio 中构建了交互式 3D 可视化工具。该模型能够生成硬件设备逼真的、符合物理比例的拆解视图,并自动将设备分解为可展开检查的层次结构。用户可以通过拆解滑块交互式地探索设备内部结构。AI模型Gemini 3.8 FlashThreeJSGoogleAIStudio10 个信源在谈事件专题推荐理由:Google 推出了 Gemini 3.8 Flash,能自动生成硬件设备的 3D 拆解视图,比普通模型更擅长复杂推理任务。原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
22:53官方账号Decoder@Maximilian Schreiner73°OpenAI将即将发布的Astra模型评为首个具备'关键'网络能力的系统。该公司计划通过监控思维链来控制该模型。然而,这种监控已被证明是模型真实决策的不可靠反映。据报告,Astra的新架构将更多思维过程推向不可读区域。随着能力提升,安全网可能正在变弱。AI模型AstraOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI的Astra模型被标记为最危险系统,新架构让监控变得更困难,安全与能力平衡面临挑战。原文稍后读已读值得跟进有用关注 Astra
15:58官方账号Latent Space (swyx)(博客/媒体)Anthropic 发布 Claude Fable/Mythos 5.1 模型,成为新的 SOTA 模型。该模型缓存价格降低 75%,同时输出 token 增加 70%。新模型在多个基准测试中表现优异,为用户提供更高性价比的选择。AI模型ClaudeFableMythos10 个信源在谈事件专题推荐理由:Anthropic 推出 Claude Fable/Mythos 5.1,价格大幅降低但输出能力提升,性价比超高。原文稍后读已读值得跟进有用关注 Claude
15:03orange.ai@oran_geFable 5.1 模型将缓存价格降至原来的四分之一。在 Agent 环境中使用,综合成本可降低 25% 至 45%。此次降价使 Opus5 的性价比优势减弱。AI模型Fable 5.1Opus5Agent2 个信源在谈事件专题推荐理由:Fable 5.1 大幅降价,缓存价格仅原价四分之一,Agent 使用成本降25-45%,Opus5性价比受挑战。原文稍后读已读值得跟进有用关注 Fable 5.1
11:53官方账号阿里通义 Qwen@Alibaba_Qwen73°Qwen3.8-Max-0902在CodeArena WebDev排行榜上以1691分位居第一,比Claude Opus 5高出3分,比Kimi K3高出17分。该模型在多步推理、工具使用和完整应用生成方面表现突出,价格为每百万token 5美元。在WebDev各个细分类别中,该模型在数据分析与消费者产品类别排名第一。AI模型Qwen3.8-Max-0902CodeArenaWebDev推荐理由:阿里Qwen3.8-Max-0902以1691分登顶CodeArena WebDev排行榜,比前代模型高出22分,价格仅5美元/百万token。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
11:08lmarena.ai@lmarena_ai73°Qwen3.8-Max-0.902由阿里巴巴发布,在Code Arena: WebDev基准测试中以1691分位居第一。该模型比Claude Opus 5高出3分,比Kimi K3高出17分,比前代Qwen3.8-Max高出22分。价格为每百万token 5美元,同时在帕累托前沿上获得最高分。该模型在数据分析、消费品开发等类别排名第一。AI模型Qwen3.8-Max-0902Alibaba_QwenCode Arena推荐理由:阿里Qwen3.8-Max-0902在代码基准测试中超越Claude和Kimi,价格实惠,多项类别领先。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
10:18官方账号阿里通义 Qwen@Alibaba_Qwen73°阿里巴巴推出Qwen3.8-Max-0902模型,参数量达2.4T,上下文窗口扩展至100万token。该模型在Code & Cowork数据上进行额外训练,在复杂企业任务、科研和长流程工作流中表现更强。QwenCloud API现已上线,输入每百万token收费2美元,输出收费6美元。AI模型Qwen3.8-Max-0902Qwen阿里巴巴推荐理由:阿里升级了Qwen3.8-Max到0902版本,参数量和上下文都大幅提升,企业级任务表现更强,价格也公布了。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
10:08官方账号arXiv cs.LG@Mariia Drozdova, Aidan Sirbu, Pietro Miotti, Robert Obryk, Mayalen Etcheverry, Eyvind Niklasson, Blake Richards精选73°研究人员将持久隐藏状态添加到扩散去噪器中,移除其时间步条件,创建了一个可运行任意深度的共享更新模型。该模型在Sudoku-Extreme上达到99.90%的精确解决率,在Maze-Unique上获得98.93%的解决率。推理过程中,每步用高斯噪声替换所有非线索变量,无需渐进去噪即可实现近乎完美的求解。论文扩散模型迭代推理Sudoku-Extreme推荐理由:新研究将扩散模型转化为迭代推理器,解决数独和迷宫问题表现优异,无需并行回滚或外部验证器。原文稍后读已读值得跟进有用关注 扩散模型
09:40官方账号arXiv cs.AI@Zhaoliang Chen, Jie Fu精选73°Latent Recurrent Thoughts (LRT) 是一种新型推理方法,在冻结大语言模型上表现优异。该方法使用小型辅助网络提供连续的潜在思想,通过微小的递归推理器进行多步优化。在Countdown-4、Sudoku、HumanEval、MBPP和StrategyQA等基准测试中,LRT显著优于之前的冻结解码器连续空间推理方法,且仅需少量推理计算即可超越非思考模式的链式思维提示。论文LRT冻结LLM推理模型推荐理由:研究人员提出LRT方法,让冻结大模型在连续表示空间中进行推理,仅需少量计算就能超越传统方法。原文稍后读已读值得跟进有用关注 LRT
08:23官方账号Simon Willison’s Weblog(博客/媒体)精选73°Claude Fable 5.1 在 Terminal-Bench-Science 0.1 基准测试中得分为 52.6%,较 Fable 5 的 24.7% 有显著提升。该模型提供五种推理级别:低、中、高、超高和最高。在生成 SVG 鸬鹚图像任务中,最高推理级别产生了最佳结果,消耗 65,927 个输出 tokens,耗时 13 分 54 秒,成本 3.30 美元。AI模型ClaudeFable推理模型6 个信源在谈事件专题推荐理由:Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。原文稍后读已读值得跟进有用关注 Claude
06:48Claude@claudeaiClaude模型在Terminal-Bench-Science 0.1测试中得分为52.6%,是Fable 5的两倍多。在Terminal-Bench 4.0测试中,Claude得分为55.8%,而Fable 5为42.0%。这些成绩表明Claude在科学任务和综合能力方面表现优异。AI模型ClaudeFable 5Terminal-Bench-Science6 个信源在谈事件专题推荐理由:Claude在两项重要基准测试中大幅领先Fable 5,科学任务得分翻倍,综合能力提升13.8%。原文稍后读已读值得跟进有用关注 Claude
04:38官方账号OpenAI@OpenAI (@OpenAI)73°OpenAI即将发布Astra模型,该模型在网络安全能力方面取得重大进展,在Preparedness框架下达到Critical阈值。OpenAI展示了如何评估该模型,以及其安全措施如何随能力一同提升。Astra代表了AI安全性和可访问性的重要进步。AI模型AstraOpenAI网络安全10 个信源在谈事件专题推荐理由:OpenAI要发Astra了,网络安全能力达到Critical级别,安全措施和能力同步升级。原文稍后读已读值得跟进有用关注 Astra
04:13Claude@claudeai73°Fable 5.1 在复杂长期任务中表现出色。该模型的研究能力展示了 AI 如何推动科学进步。Fable 5.1 是 Anthropic 公司的最新模型版本。该模型在处理复杂任务方面有明显优势。AI模型FableAnthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic 发布 Fable 5.1,擅长处理复杂长期任务,为科学进步提供新视角。原文稍后读已读值得跟进有用关注 Fable
04:13Mike Krieger@mikeyk73°Anthropic今日推出Claude F5.1和Claude Mythos 5.1两款新模型。Fable 5.1专注于复杂多步骤工作,在编程、知识工作和长期问题解决任务上表现优异。这两款模型被定位为全球最先进的编程和知识工作模型。AI模型ClaudeFableAnthropic10 个信源在谈事件专题推荐理由:Anthropic刚发了Fable 5.1,专门处理复杂任务,比之前的版本更强了。原文稍后读已读值得跟进有用关注 Claude
04:04DeepLearning.AI@DeepLearningAI73°OpenAI展示GPT 5.6 Sol每秒处理750个token。Google发布Gemini 3.7 Flash平均每秒330个token。Nvidia推出Nemotron 3.5 Lightning并配备NeMo Switchyard动态步进路由技术。更快的吞吐量和更低的延迟可减轻开发者上下文切换负担。这些模型支持实时智能体工作流。AI模型GPT 5.6Gemini 3.7Nemotron 3.510 个信源在谈事件专题推荐理由:OpenAI、Google和Nvidia都在竞相提升AI模型推理速度,各有不同技术方案。原文稍后读已读值得跟进有用关注 GPT 5.6
03:45elvis@omarsar073°Claude推出Fable 5.1模型,在典型工作负载上降低成本约25%,在高智能体任务上降低约45%。该模型针对科学工作流程进行了优化,提高了令牌效率,在写作和文本生成方面表现更佳。Opus 5仍能满足大多数任务需求,而Fable 5.1则作为更复杂协调器和验证者。AI模型ClaudeFable 5.1Opus 53 个信源在谈事件专题推荐理由:Claude新出的Fable 5.1比Opus 5成本更低,特别适合科学工作流,是日常使用的不错选择。原文稍后读已读值得跟进有用关注 Claude
02:47Claude@claudeai78°Anthropic推出Claude Fable 5.1和Claude Mythos 5.1两款新模型。这两款模型被定位为全球最先进的编程和知识工作模型。Claude Fable 5.1专注于代码生成与优化,Claude Mythos 5.1则针对复杂知识任务。两款模型均基于Anthropic最新的AI技术架构构建。AI模型Claude Fable 5.1Claude Mythos 5.1Anthropic10 个信源在谈事件专题推荐理由:Anthropic新推Claude Fable和Mythos 5.1,专为编程和知识工作设计,比前代更强。原文稍后读已读值得跟进有用关注 Claude Fable 5.1
02:25Gary Marcus@GaryMarcus纯扩展大模型确实遇到了性能瓶颈。神经符号AI通过结合符号推理弥补了LLM的不足。这种结合方法使AI系统超越了纯LLM的性能限制。神经符号AI的初衷就是解决LLM的固有弱点。AI模型LLM神经符号AIGaryMarcus推荐理由:GaryMarcus指出纯扩展LLM已到极限,神经符号AI通过工具和约束解决了这一问题原文稍后读已读值得跟进有用关注 LLM
23:13DeepLearning.AI@DeepLearningAI78°Z.ai的GLM-5.3模型在CyberGym漏洞基准测试中达到84.5%的准确率。这一成绩超越了多个顶级专有模型。相比前代GLM-5.2,GLM-5.3实现了显著性能提升。Z.ai团队通过微调和优化模型智能体能力实现这一突破,未更改基础模型。AI模型GLM-5.3Z.aiCyberGym推荐理由:Z.ai的GLM-5.3在安全测试基准上超越专有模型,仅靠微调实现,还因能力过强暂不公开权重。原文稍后读已读值得跟进有用关注 GLM-5.3
22:53OpenRouter@OpenRouterAI78°Mercury 2.5 Preview推理模型在OpenRouter平台发布,速度达1,107 tokens/sec。该模型支持并行token生成和并行工具调用功能。模型具有可调节推理能力和schema-aligned JSON输出。专为低延迟工作负载设计。AI模型Mercury 2.5 PreviewOpenRouter推理模型推荐理由:Mercury 2.5 Preview来了,推理速度超1100 tokens/sec,还支持并行工具调用,比普通模型快多了。原文稍后读已读值得跟进有用关注 Mercury 2.5 Preview