13:08Geek@geekbb在包含940道题的Extended NYT Connections基准上,DeepSeek V4 Flash取得89.6分,位列第一。Gemini 3.6 Flash以89.0分紧随其后。Qwen 3.7 Plus的成绩为74.8分,Gemini 3.5 Flash-Lite为60.4分。Qwen 3.7 Flash和Qwen3.6-35B-A3B分别只拿到43.8和41.6分。AI模型DeepSeek V4 FlashGemini 3.6 FlashQwen 3.7 Plus10 个信源在谈事件专题推荐理由:DeepSeek V4 Flash在谜题基准拿到89.6,赢了Gemini 3.6的89.0,推理表现很亮眼。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
01:16elvis@omarsar082°OpenAI研究员Sebastien Bubeck表示,Astra是OpenAI下一个主要模型,已独立证明多个数学难题。OpenAI将发布10个Astra证明,每个都附带完整Lean证书和思维链(CoT)推演。结果包括对von Neumann代数中Connes刚性猜想的反驳,以及高维球堆积、电路复杂度、多色图中单色三角形的更好界限。这一进展让独立研究者对AI驱动的科学发现感到兴奋。AI模型AstraOpenAI数学证明10 个信源在谈事件专题推荐理由:OpenAI的Astra模型一口气放出10个数学证明,还带Lean验证和推理过程,数学爱好者可以围观了。原文稍后读已读值得跟进有用关注 Astra
01:06Kevin Weil@kevinweil78°OpenAI 官网发布 Ten Advances in AI Reasoning 页面,公开十项推理评估结果。首席产品官 Kevin Weil 在 X 上转发,称每项结果都是领域内的重要进展。他祝贺 Sebastien Bubeck、Mark Chen 等团队,并展望全球用户都能用上该模型。页面可用来对比当前推理模型的评测表现。AI模型OpenAI推理模型基准测试10 个信源在谈事件专题推荐理由:OpenAI把十个推理基准成绩一次性亮出来,Kevin Weil说是领域级结果。想了解新模型强在哪,直接翻这份榜单。原文稍后读已读值得跟进有用关注 OpenAI
00:21官方一手歸藏(guizang.ai)@op741882°OpenAI在X平台预热下一代模型Astra,称其解决了10个存在至少十年的数学问题。OpenAI研究负责人Sebastien Bubeck确认,Astra完成了多项成果,包括推翻Connes刚性猜想、改进高维球堆积和电路复杂性的界。这些证明将附带Lean证书和思维链(CoT)逐步讲解,并以论文形式发布。据称整个求解过程的算力成本仅约2000美元,OpenAI CEO Sam Altman已赴华盛顿与美政府沟通发布事宜。AI模型OpenAIAstra数学推理10 个信源在谈事件专题推荐理由:OpenAI说新模型Astra用2000美元算力解了10个老数学难题,连数学家都难搞定,还附Lean证明,感觉是真翻身了。原文稍后读已读值得跟进有用关注 OpenAI
00:20官方账号Decoder@Matthias Bastian76°OpenAI用AI反驳了单位距离猜想,引发数学界关注。菲尔兹奖得主Timothy Gowers表示,GPT-5.6 Pro首次尝试就解决了他长期研究过的两个问题。他警告这可能造成数学文化消亡,因为数学家不再构建理解结果所需的知识。另一些研究者则把AI视为提升效率的工具。AI模型OpenAIGPT-5.6 Pro单位距离猜想10 个信源在谈事件专题推荐理由:菲尔兹奖得主自己说GPT-5.6 Pro一次就解出他头疼的问题,还警告数学文化危险,这篇值得看。原文稍后读已读值得跟进有用关注 OpenAI
15:59官方账号Greg Brockman@gdb76°OpenAI下一代模型Astra的内部版本解决了10个数学与理论计算机科学问题,总成本约2000美元。官方发布了10个Astra证明,每个都附带Lean证书和思维链走查。成果包括反驳Connes刚性猜想、改进高维球堆积界限、给出电路复杂度新界限,并确认nonsofic群存在。另外还改进了多色图中单色三角形的界限。AI模型AstraOpenAILean10 个信源在谈事件专题推荐理由:OpenAI的Astra模型花约2000美元解出10个数学难题,证明还带Lean验证,硬核得让人服气。原文稍后读已读值得跟进有用关注 Astra
10:13Fireworks AI@FireworksAI_HQ72°DeepSeek-V4-Flash-0731已在Fireworks平台上线,支持日零部署。DeepSeek报告该模型在全部9项智能体评测中超越V4 Pro,其中Terminal Bench得分82.7%。其性价比优于V4 Pro,定价为每百万tokens 0.28美元,上下文窗口达100万tokens。AI模型DeepSeekV4-Flash-0731Fireworks推荐理由:Fireworks当天上线了DeepSeek最新模型,智能体评测全面超过V4 Pro,价格还更便宜,适合跑高并发任务。原文稍后读已读值得跟进有用关注 DeepSeek
08:29官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek-V4-Flash-0731正式发布,参数量304B,在Hugging Face上体积167GB。Artificial Analysis评估其综合智能排名超过428B参数的MiniMax M3。输入价格每百万token 0.14美元,输出0.27美元,是目前性价比最高的模型之一。在默认推理等级下生成质量一般,但将reasoning_effort调至high后效果显著提升。AI模型DeepSeek-V4-Flash-0731DeepSeek智能体推荐理由:DeepSeek新模型便宜又能打,304B参数干翻428B的MiniMax M3,记得把推理等级调高。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
02:05官方账号Decoder@Matthias Bastian72°Thinking Machines 发布了开放权重的推理模型 Inkling Small,这是其第二款模型。它的体积不到前作 Inkling 的三分之一,但在多项编程和推理基准上表现优于 Inkling。该实验室由前 OpenAI CTO Mira Murati 创立,这次选择用更小的参数规模换取更高效率。AI模型Inkling SmallThinking MachinesMira Murati10 个信源在谈事件专题推荐理由:Mira Murati 的实验室发了新模型,比前作小三分之二,编程推理分数反而更高,开源可下载。原文稍后读已读值得跟进有用关注 Inkling Small
01:55Google Gemini App@GeminiApp72°谷歌发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 升级版。新版本在推理能力和响应速度上均有提升。用户可在 gemini.google 或 App 的模型下拉菜单中切换使用。两个模型目前均已开放体验。AI模型GeminiGemini 3.6 FlashGemini 3.5 Flash-Lite1 个信源在谈事件专题推荐理由:谷歌把 Flash 和 Flash-Lite 都升级了,推理更强速度更快,打开 Gemini 选模型就能试。原文稍后读已读值得跟进有用关注 Gemini
15:47IT之家(博客/媒体)79°OpenAI通过两项框架改进,让GPT-5.6 Sol在ARC-AGI-3基准得分从7.8%升至38.3%。改进前的官方框架会丢弃私有推理,且滚动截断窗口导致早期动作丢失。OpenAI提出推理保留和上下文压缩两个方案,分别解决上述问题。启用改进后,GPT-5.6 Sol输出token降至六分之一,成绩增长188.42%。AI模型GPT-5.6 SolOpenAIARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI给GPT-5.6 Sol换了套测试框架,ARC-AGI-3得分从7.8%涨到38.3%,输出还省了六分之五,这招挺妙。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
13:53官方账号Greg Brockman@gdb76°GPT-5.6 Sol 找到了 Maxwell 猜想的反例,证实该猜想错误。这一猜想已存在超过 100 年,反例由 AI 发现后经人类数学家确认,论文已上传至 arXiv(编号 2607.27197)。成果展示了 GPT-5.6 Sol 在数学推理上的具体能力。AI模型GPT-5.6 SolMaxwell conjecture推理模型推荐理由:GPT-5.6 Sol 直接给 Maxwell 猜想找出了反例,人类数学家还验证了,这推理能力真有点吓人。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
12:31官方账号arXiv cs.LG@Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang论文提出β-OPSD,将普通在线自蒸馏(OPSD)推广为β=1特例的策略优化家族。β作为正则化参数,控制学生模型相对参考策略与特权教师之间的权衡。最优策略被推导为参考策略与教师的几何插值,实现时混合二者的token级logits。在数学推理基准上,β-OPSD比vanilla OPSD更稳定、推理性能更好。论文β-OPSD自蒸馏策略优化推荐理由:这篇论文把OPSD的隐式β变成可控参数,用蒸馏近似强化学习,数学推理上比原版更稳更强。原文稍后读已读值得跟进有用关注 β-OPSD
12:21官方账号arXiv cs.LG@Alexander Boesgaard Lorup该论文在 Qwen2.5 衍生系统上用 200 项配对实验对比保留 live cache 与一次性 prefill。BF16 下两种构造在 166 个后缀和 20 个正确性标签上出现分歧,准确率差 1 个百分点(95% CI [-3.5, +5.5])。FP32 固定前缀 2x2 对比没有解码分歧(Wilson 95% 上限 1.88%)。跨 48 层 key/value 的双向缓存移植让每个测试分歧跟随缓存供体(24/24 和 43/43)。论文Qwen2.5KV Cache推理模型推荐理由:用Qwen2.5做200组实验:BF16有166处分歧,FP32无分歧;移植48层KV缓存后分歧跟随供体。原文稍后读已读值得跟进有用关注 Qwen2.5
08:09Scott Wu@ScottWu46Cognition 更新了 FrontierCode 1.1 基准,为 GPT-5.6 Terra 和 GPT-5.6 Luna 提供新折扣。更新后 GPT-5.6 系列在价格/性能效率上位于帕累托曲线前沿。所有 Devin 用户将自动享受到成本下降,无需手动调整。AI模型GPT-5.6FrontierCodeDevin推荐理由:GPT-5.6 系列降价了,在 FrontierCode 上性价比拉满,用 Devin 的自动省钱。原文稍后读已读值得跟进有用关注 GPT-5.6
06:44官方账号OpenAI@OpenAI (@OpenAI)ARC-AGI-3基准测试要求模型无需指令学习不熟悉的2D游戏。标准测试丢弃了GPT-5.6 Sol每步后的推理,并在上下文填满时丢弃早期动作。这导致模型无法积累有效经验,只能不断重启。测试结果凸显了长上下文维持对推理模型的关键性。AI模型ARC-AGI-3GPT-5.6 SolOpenAI10 个信源在谈事件专题推荐理由:ARC-AGI这个测试挺刁钻,GPT-5.6 Sol在没法记住之前推理的情况下学不会新游戏,说明长上下文对推理很重要。原文稍后读已读值得跟进有用关注 ARC-AGI-3
04:48Cognition@cognition_labsCognition更新了编码基准FrontierCode 1.1,以反映GPT-5.6 Terra和GPT-5.6 Luna的新成本折扣。基于更新后的价格,GPT-5.6系列在价格/性能效率上处于帕累托曲线前沿。这意味着该系列模型在同等性能下更具成本优势。AI模型GPT-5.6 TerraGPT-5.6 LunaFrontierCode推荐理由:GPT-5.6系列降价了,在FrontierCode基准上性价比更突出了,做编码任务可以关注下。原文稍后读已读值得跟进有用关注 GPT-5.6 Terra
03:33官方账号Sam Altman@samaOpenAI 在部署后应用 GPT-5.6 Sol 进行效率自优化,让模型自身改进运行效率。结果显示,通过生产 GPU 内核优化,服务成本降低 20%。此外,改进的投机解码使 token 生成效率提升 15% 以上。这一成果展示了模型自我优化的实际收益。AI模型GPT-5.6 SolOpenAI效率优化10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 通过自学习优化运行,服务成本降了 20%,生成速度提了 15%,比手动调优更省心省钱。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:16OpenRouter@OpenRouterAI77°OpenAI 宣布 GPT-5.6 Luna 降价 80%,GPT-5.6 Terra 降价 20%。GPT-5.6 Sol 在 API 中提供更快的推理选项。降价后,在 Codex 和 ChatGPT Work 中的用量计算方式同步调整,用户使用额度更耐用。AI产品GPT-5.6OpenAIAPI定价10 个信源在谈事件专题推荐理由:OpenAI 给 GPT-5.6 系列降价了,Luna 降八成、Terra 降两成,Sol 还更快。正在用这些模型做产品或开发的,赶紧看下新价格和用量规则。原文稍后读已读值得跟进有用关注 GPT-5.6
02:12官方账号NVIDIA AI@NVIDIAAI精选Thinking Machines 发布 Inkling-Small,总参数量 276B,活跃参数 12B,性能与 Inkling 相当但体积仅为四分之一。该模型原生支持音频和图像推理,并具备可变思考努力能力。完整权重已开放,可使用 NVIDIA NeMo 在 DGX Station 上微调。用户可在 Tinker 上通过文本、图像或音频方式与之交互。AI模型Inkling-SmallThinking Machines多模态6 个信源在谈事件专题推荐理由:Thinking Machines 出了个 Inkling-Small,276B 参数量但只激活 12B,能处理音频和图像,性能不打折,适合拿来微调玩。原文稍后读已读值得跟进有用关注 Inkling-Small
01:40官方账号OpenAI@OpenAI (@OpenAI)81°OpenAI 通过 GPT-5.6 Sol 实现自身运行效率提升,使服务成本降低 20%。改进推测解码后,令牌生成效率提升 15% 以上。这些优化已转化为 Luna 和 Terra 模型的 API 价格下调。OpenAI 旨在让先进智能更普及。AI模型GPT-5.6 SolLunaTerra10 个信源在谈事件专题推荐理由:OpenAI 又升级了,GPT-5.6 Sol 让运行成本降了20%,速度快了15%,Luna 和 Terra 也降价了,开发者快看。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
23:32Google AI Developers@googleaidevs75°谷歌发布Gemini Robotics ER 2,这是其最强的具身推理模型。该模型连接Gemini Live API,可处理连续视频流、调用工具、搜索网页并实时命令动作模型。升级包括增强进度跟踪、实时执行失败检测、多机器人协作和高级安全指令遵循。面向开发者,提升机器人控制能力。AI模型Gemini Robotics ER 2Gemini Live APIGoogle推荐理由:谷歌出了Gemini Robotics ER 2,能边看视频边指挥机器人,还支持多机器人协作和实时纠错,搞机器人的必须关注。原文稍后读已读值得跟进有用关注 Gemini Robotics ER 2
22:14Latent.Space@latentspacepod本体论作为经典知识表示工具,正被AI工程师用于约束LLM和Agent行为。Frank Coyle和Emile Ifrem在aiDotEngineer World's Fair上展示了如何用本体论保持模型输出诚实、确保Agent遵循确定性路径。这种方法利用旧网络技术为概率模型设置规则边界,减少幻觉和偏离。技巧ontologiesLLMAgent推荐理由:想治LLM乱编和Agent跑偏?看看本体论这个老办法怎么新用。两个实际案例,讲得明白。原文稍后读已读值得跟进有用关注 ontologies
17:57官方账号OpenAI@OpenAI72°OpenAI 通过 Responses API 实现了一项测试,启用了 Retained reasoning 和 Context compaction 功能。在公开数据集上,GPT-5.6 Sol 的得分提升了 188%,同时输出 token 数量减少了 6 倍。这一改进显著提高了模型的推理效率和输出质量。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 用 Responses API 让 GPT-5.6 Sol 分数涨了 188%,输出 token 还少了 6 倍,效率提升很明显。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
15:47官方账号Decoder@Matthias Bastian82°OpenAI声称其GPT-5.6 Sol模型在ARC-AGI-3基准测试中通过自定义测试环境获得38.3%的分数,高于Anthropic Opus 5的30.2%。但在官方标准环境下,GPT-5.6 Sol仅得7.8%,远低于Opus 5的30.2%。OpenAI的定制测试保留了推理链和上下文压缩作为辅助手段,而Opus 5在无辅助下完成。这一差异引发了关于基准测试公平性的讨论。AI模型GPT-5.6 SolOpus 5ARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
13:59IT之家(博客/媒体)72°SpaceXAI发布Grok Voice Think Fast 2.0语音模型,每分钟音频费用0.08美元。该模型在AA Speech-to-Speech Quality Index达82.9%,较1.0版提升7.2个百分点。xAI内部评估显示,转录表现较Deepgram Nova 3和ElevenLabs Scribe v2提升1.5-2.0倍,较1.0版提升1.4倍。在背景噪声场景下,与专用语音转文字模型的差距可扩大至约10倍。模型支持24种语言,可在说话时同步完成推理。AI模型Grok Voice Think Fast 2.0SpaceXAIDeepgram Nova 31 个信源在谈事件专题推荐理由:SpaceXAI刚发的Grok Voice Think Fast 2.0,语音转语音又快又准,一分钟才8分钱,比上一代强了一大截,还支持24种语言,适合做语音助手。原文稍后读已读值得跟进有用关注 Grok Voice Think Fast 2.0
13:31小互@imxiaohu81°OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 公开题库中仅得 13.3%,原因是推理过程中的私有思考被丢弃,上下文到达阈值后直接删除早期消息。通过开启 Responses API 将上一次响应 ID 传回以保留推理链,并启用 compaction 将超限上下文压缩为浓缩摘要,得分升至 38.3%。最高档每局输出 token 从 290 万降至 49 万,新程序在“高”档即达到旧程序“最高”档的分数,token 消耗相差约 12 倍。技巧GPT-5.6OpenAIARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI 分享了两个超实用的 API 开关,GPT-5.6 Sol 在 ARC-AGI-3 上分数直接翻了三倍,token 还省了十二倍,搞推理优化的一定要看看。原文稍后读已读值得跟进有用关注 GPT-5.6
11:09小互@imxiaohuMagnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。技巧Magnific提示词工程推理模型推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。原文稍后读已读值得跟进有用关注 Magnific
10:33SuperTechFans(博客/媒体)精选TurboFieldfare 是一个采用 Swift 和 Metal 编写的开源推理运行时,专为 Apple Silicon Mac 设计。它通过 SSD 流式加载专家权重,使 Gemma 4 26B-A4B 模型仅需约 2GB 内存即可运行,无需加载完整的 14.3GB 模型。实测在 8GB M2 MacBook Air 上达到 5.1-6.3 tok/s,在 24GB M5 Pro 上达到 31-35 tok/s。项目提供本地 Mac 应用、CLI 和 OpenAI 兼容服务器,要求 macOS 26、Metal 4 和 Xcode 26。AI模型TurboFieldfareGemma 4Apple Silicon10 个信源在谈事件专题推荐理由:想在老 Mac 上跑大模型?这个开源引擎让 Gemma 4 26B 只需 2GB 内存就能跑起来,M2 上还有 5-6 tok/s,挺实用的。原文稍后读已读值得跟进有用关注 TurboFieldfare
10:32官方账号arXiv cs.AI@Mehrad Yaghoubi, Azam Bastanfard, Abbas Jalilvand, Ashkan Rezaei该论文提出Belief-Guided架构,将策略头与信念头分离,后者作为内部模拟器和独立批评者,建模认知不确定性和战略稳定性。通过Transformer/GRU处理长期依赖和劫争规则,并利用门控机制过滤过度自信的策略错误。实验表明,该架构显著提升无需搜索的胜率并减少幻觉,在消费者级硬件上实现专业水平对弈,而传统方法需要大规模MCTS。AI模型Belief-Guided围棋AIMCTS推荐理由:这篇论文提出一个新架构,让围棋AI不用大量搜索也能在普通电脑上达到专业水平,比AlphaZero更省资源。原文稍后读已读值得跟进有用关注 Belief-Guided
10:30官方账号Simon Willison@simonw精选GPT-5.6 通过 Codex 分析生产流量、改进负载均衡、重写 GPU kernel 和运行数百次推测解码实验,将端到端服务成本降低 20%。推测解码使 token 生成效率提升超 15%。这些优化为 OpenAI 每月节省数十亿美元成本。AI模型GPT-5.6Codex推理模型10 个信源在谈事件专题推荐理由:GPT-5.6 自己优化自己,服务成本降了20%,生成效率提了15%,省下来的钱都能买好几个数据中心了。原文稍后读已读值得跟进有用关注 GPT-5.6
10:09官方一手Pandaily@contact@pandaily.com (Pandaily)蚂蚁集团旗下Ant Bailing推出Ling-3.0-flash执行模型,总参数量124B,激活参数仅5.1B。该模型在12个基准测试中,以12%的参数量在11项上超越万亿参数模型Ring-2.6。在34个评估维度中,Ling-3.0-flash获得15个第一、19个第二,与DeepSeek V4 Flash并列平均最高分。AI模型Ling-3.0-flashAnt BailingRing-2.610 个信源在谈事件专题推荐理由:蚂蚁百灵的新模型Ling-3.0-flash参数量只有124B,却在大多数基准测试里干翻了万亿参数的Ring-2.6,还和DeepSeek V4 Flash并列第一,小模型也能这么猛。原文稍后读已读值得跟进有用关注 Ling-3.0-flash
09:37官方账号Sam Altman@samaSam Altman 转发消息称,OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 基准测试中达到 SoTA(最高性能)。该模型仅通过两个设置变化实现:允许其在多个上下文窗口中进行推理,并配合规范化的压缩实现。这一结果暗示通过调整推理机制,模型在挑战性视觉推理任务上表现显著提升。目前官方博客已发布详细方法说明。AI模型GPT-5.6 SolOpenAIARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol 改了俩设置就在 ARC-AGI-3 上屠榜,教你多窗口推理+规范化压缩这套新打法。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
07:18官方一手@OpenAIDevs@OpenAIDevs78°OpenAI 使用 GPT-5.6 Sol 模型在 Codex 环境中对自身基础设施进行优化,改进在推理和智能体循环中产生更多有用工作。生产 GPU 内核优化使服务成本降低 20%,改进的推测解码使 token 生成效率提升 15% 以上。这些改进通过复用在相同硬件上获得更大的性能提升。AI模型GPT-5.6 SolCodexOpenAI10 个信源在谈事件专题推荐理由:OpenAI 让最新的 GPT-5.6 Sol 自己给自己打工,结果运行成本降了 20%、输出速度提升超 15%,看看模型怎么自己优化自己。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
07:12官方一手OpenAI Blog(博客/媒体)OpenAI 通过启用两个 API 设置(保留推理轨迹和启用结果压缩)让模型在 ARC-AGI-3 基准上的得分提升至原来的三倍。这些设置分别作用于推理过程和输出压缩,不增加额外计算成本。具体配置方法在官方博客中公开。技巧ARC-AGI-3OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 官方分享的实用技巧,只改两个参数就让 ARC-AGI-3 分数翻三倍,玩模型的可以试试。原文稍后读已读值得跟进有用关注 ARC-AGI-3
05:33官方账号OpenAI@OpenAI85°OpenAI 推文宣布推出 GPT-5,通过全栈优化(涵盖架构、训练与推理)在成本-智能曲线上每个点都达到最佳性能。该模型系列包含多种版本,针对不同计算成本进行调优。具体基准成绩尚未公开,但声称在各成本区间均保持领先。AI模型OpenAIGPT-5推理模型10 个信源在谈事件专题推荐理由:OpenAI 发了 GPT-5 系列,从低到高每个价位都做了性能最优的版本,想省钱或追求极致都能选到合适的。原文稍后读已读值得跟进有用关注 OpenAI
04:04官方一手OpenAI Blog(博客/媒体)OpenAI发布GPT-5.6,该模型在模型架构、推理过程和智能体工作流上进行了效率优化,旨在提升每美元实现的智能水平。AI模型GPT-5.6OpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI新模型GPT-5.6,在模型、推理和智能体效率上都有提升,每美元能换更多智能,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6
03:44官方账号xAI@xaixAI 发布 Grok Voice Think Fast 2.0,专为语音代理设计。该模型在嘈杂环境下能保持清晰听取。它能推理复杂工作流,并生成更自然的对话。相比前代,在实时交互中延迟更低、鲁棒性更强。AI模型Grok VoicexAI语音模型1 个信源在谈事件专题推荐理由:xAI 出了个新语音模型,专门解决噪声环境下听不清的问题,还能处理复杂任务,适合做语音助手的开发者试试。原文稍后读已读值得跟进有用关注 Grok Voice
01:48OpenRouter@OpenRouterAI阿里巴巴的Qwen3.7-Flash模型在OpenRouter平台正式上线。该模型具备视觉能力,支持多模态代理、视觉编码、搜索和计算机交互,上下文窗口达100万tokens。同时支持工具调用,适合快速推理场景。AI模型Qwen3.7-FlashOpenRouter阿里巴巴推荐理由:阿里新模型上线OpenRouter,百万上下文还能看图和操作电脑,多模态推理速度很快。原文稍后读已读值得跟进有用关注 Qwen3.7-Flash
00:15lmarena.ai@lmarena_ai82°Anthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中排名第二,基于超过 7000 次真实代理会话,净提升 11.88%。Opus 5 (High) 紧随其后排名第三,净提升 11.73%,两者均低于第一名 Fable 5,但高于 GPT-5.6 Sol (xHigh)。在 Frontend Code Arena 中,Opus 5 Max 排名第一,Opus 5 High 排名第三(落后于 Kimi K3)。在 Text Arena(事实性开启)中,Opus 5 Max 位列第一,Opus 5 High 第二。这些成绩基于全球社区的百万级真实长周期任务评测。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。原文稍后读已读值得跟进有用关注 Claude Opus 5