17:37官方账号NVIDIA AI@NVIDIAAI75°NVIDIA 宣布向 Open Secure AI Alliance 贡献开源模型、权重、数据和研究,包括其 NVIDIA Labs 开发的 Object-Oriented Agents (NOOA) 框架。NOOA 是一个面向对象的智能体框架,在软件工程、网络安全和推理基准上达到 state-of-the-art 结果。开发者可以利用该框架优化自己的智能体设计并回馈社区。该联盟由 NVIDIA 与行业领导者共同发起,旨在通过开放协作开发新技术和工具来保护软件和智能体安全。AI模型NVIDIANOOA开源模型10 个信源在谈事件专题推荐理由:NVIDIA 开源了 NOOA 智能体框架,在软件工程和网络安全基准上做到了最先进水平,还带数据和模型,搞安全智能体的可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
12:06IT之家(博客/媒体)小米集团徐洁云透露,上周全球调用量排名前五均为中国AI大模型。其中小米MiMo-V2.5升至第一,周调用量达10.5万亿Token,环比增长12%。该系列于4月23日开启公测,包含MiMo-V2.5、V2.5-Pro、V2.5-TTS Series、V2.5-ASR等版本。此外,小米还对Token Plan定价方案进行了优化。这显示中国AI大模型在全球实际使用中的领先地位。行业小米MiMo-V2.5智能体1 个信源在谈事件专题推荐理由:小米的MiMo-V2.5模型全球调用量冲到第一,一周用了10.5万亿Token,超过了其他国内大模型,说明它实际用的人真多。原文稍后读已读值得跟进有用关注 小米
11:45AI Will@FinanceYF572°Claude Opus 5由Anthropic发布。用户分享了10个应用案例。这些案例展示了Claude Opus 5的多种用途。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic的Claude Opus 5刚出,就有10个酷案例,来看看它到底能干啥。原文稍后读已读值得跟进有用关注 Claude Opus 5
11:41量子位@量子位的朋友们蚂蚁百灵发布了新一代原生混合推理模型Ling-3.0-Flash。该模型在MATH-500和HumanEval基准上取得了领先成绩,推理速度相比上一代有显著提升。它支持文本与代码等多模态输入,已通过百灵开放平台提供API。AI模型Ling-3.0-Flash蚂蚁百灵推理模型推荐理由:蚂蚁百灵出了Ling-3.0-Flash,数学和代码能力强,速度更快,开发者直接调API就能用。原文稍后读已读值得跟进有用关注 Ling-3.0-Flash
11:01Gary Marcus@GaryMarcusGary Marcus 引用 Ramez Naam 的推文,指出 Opus 5 在 ARC-AGI-3 基准上的成绩提升可能源于针对该评估的专门训练,而非抽象推理能力的普遍增强。该观点质疑当前用基准分数衡量 AGI 进展的有效性。推文获得 4 条回复、1 次转发和 10 个点赞。行业Opus 5ARC-AGI-3Gary Marcus10 个信源在谈事件专题推荐理由:Opus 5 的基准高分可能是刷出来的,看看专家怎么拆穿这个骗局。原文稍后读已读值得跟进有用关注 Opus 5
11:01orange.ai@oran_geKun Chen 指出 Opus 5 在多项公开基准上超越 Fable 5,但在实际使用中远不如 Fable 5,认为现有基准已几乎无用。他信任基于私有数据集的领域特定评估。他还透露 Anthropic 在 5 系列中先训练 Mythos 再蒸馏到 Sonnet 和 Opus,导致 Sonnet 5 失败、Opus 5 评价混杂。Chen 表示 Claude 系列使用体验变差,Grok 和 Kimi 目前在“愉悦感”维度上更优。AI模型Opus 5Fable 5Anthropic10 个信源在谈事件专题推荐理由:这条推文直指 Opus 5 和 Fable 5 的基准与体验反差,还爆出 Anthropic 新的蒸馏训练路径,以及 RLHF 被弱化导致的体验变化,值得看看。原文稍后读已读值得跟进有用关注 Opus 5
18:01官方账号Decoder@Matthias Bastian86°Anthropic的Claude Opus 5在ARC-AGI-3基准测试中取得30.2%的成绩,接近此前GPT-5.6 Sol记录7.8%的四倍。测试开发者指出,Opus 5是首个独立推导出反射方程的模型,这一行为此前从未在其他模型中出现。开发者认为这归因于其更强的逻辑推理能力。ARC-AGI-3被设计为衡量真实智能的测试。AI模型Opus 5GPT-5.6 SolAnthropic10 个信源在谈事件专题推荐理由:Anthropic的Opus 5在智能测试上把GPT-5.6 Sol甩开一大截,还自己学会推方程了。原文稍后读已读值得跟进有用关注 Opus 5
17:54官方账号Decoder@Matthias BastianAnthropic 的 Claude Opus 5 在 Artificial Analysis Intelligence Index 中获得 61 分,超过 Claude Fable 5 和 GPT-5.6 Sol。该模型在分析质量和编程基准上得分最高。其成本在更低推理层级下仅为 Fable 5 的一半。不过领先优势并不大,竞争仍然激烈。AI模型Claude Opus 5Fable 5GPT-5.6 Sol10 个信源在谈事件专题推荐理由:Claude Opus 5 性能不输更贵的 Fable 5,编程和分析很强,性价比高,值得关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
11:19shao__meng@shao__meng85°Anthropic 发布 Claude Opus 5,声称其智能接近 Fable 5,价格仅为 Fable 5 的一半,且与 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens)。在基准测试中,Opus 5 在 Frontier-Bench v0.1 上达到新 SOTA,比 Opus 4.8 性能提升超过一倍;在 ARC-AGI-3 上得分是第二名模型的 3 倍。在计算机使用任务 OSWorld 2.0 中,Opus 5 以仅三分之一成本超越 Fable 5 的最佳成绩。新的快速模式提供 2.5 倍速度但价格翻倍;API 自动 fallback 功能可将被安全分类器拦截的请求降级到其他模型。AI模型Claude Opus 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:Anthropic 发了 Opus 5,智能接近 Fable 5 但价格砍半,编码和推理效率超强,日常用很划算。原文稍后读已读值得跟进有用关注 Claude Opus 5
11:13shao__meng@shao__meng75°马斯克在X上宣布,Grok 4.6将在两周内发布,Grok 4.7则在四周内发布。SpaceXAI的训练和发布速度极快,Grok 4.6的生命周期可能仅有14天。有猜测认为,Grok 4.6和Grok 4.7可能是针对不同能力或价位设计的互补模型。AI模型GrokSpaceXAI马斯克推荐理由:马斯克一口气官宣两个版本,Grok更新快得离谱,看看4.6和4.7到底怎么分工。原文稍后读已读值得跟进有用关注 Grok
11:07@hebbia@hebbia71°Hebbia 宣布在其平台中提供 Claude Opus 5。该模型在 Hebbia 的金融服务基准测试中,推理和引用准确性相比先前模型有显著提升。对于投资银行、私募股权公司和信贷基金,这意味着在收益分析、可比公司、尽职调查等工作流中输出更可靠。AI模型Claude Opus 5Hebbia金融推荐理由:Hebbia 上线了 Claude Opus 5,金融场景下推理和引用更准了,做收益分析和尽调更靠谱。原文稍后读已读值得跟进有用关注 Claude Opus 5
11:00向阳乔木@vista8One2X公司王冠发文,借黄仁勋X平台首帖观点,将中美大模型竞争比喻为爬珠穆朗玛峰:美国从南坡靠训练驱动,中国从北坡靠推理驱动。文章指出两国持有不同资源牌面(美国阶跃式英雄史观,中国渐进式人民史观),导致AGI发展路径完全相反。行业One2X黄仁勋中美AI竞争推荐理由:王冠用登山比喻讲清中美AI路线差异,训练vs推理、英雄史观vs人民史观,看完对两国策略更有数。原文稍后读已读值得跟进有用关注 One2X
08:58SuperTechFans(博客/媒体)85°Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,智能水平接近 Claude Fable 5 但价格减半。该模型支持可调努力程度,在 Frontier-Bench、CursorBench 等多项基准测试中超越前代,尤其在软件工程、知识推理和自动化任务上表现突出。Opus 5 无数据保留要求,相比 Fable 的 30 天政策更受组织欢迎。实际使用中成本低于 Sonnet,早期客户反馈在调试、根因分析和自动化工作流中达到 100% 通过率。AI模型Claude Opus 5AnthropicClaude Fable 510 个信源在谈事件专题推荐理由:Anthropic 新模型 Opus 5 智能接近 Fable 5 但价格减半,数据保留更灵活,适合团队用更少的钱获得顶尖推理能力。原文稍后读已读值得跟进有用关注 Claude Opus 5
08:13orange.ai@oran_ge评价称Opus 5的智能水平略微超过降智后的Fable 5,且价格保持为Fable 5的一半。OpenAI的开源模型已超过旧版Opus 4.8。Opus 4系列在引领上半年后逐渐退场。评论认为在开源巨浪下,这些模型都将成为浪花。AI模型Opus 5Fable 5Opus 4.810 个信源在谈事件专题推荐理由:Opus 5干过了降智版的Fable 5,价格还便宜一半,开源模型也追上来了,值得关注这波模型更迭。原文稍后读已读值得跟进有用关注 Opus 5
07:57官方账号Simon Willison’s Weblog(博客/媒体)78°Anthropic 推出 Claude Opus 5,定价与 Opus 4.8 相同,并保留双倍价格的快速模式。该模型在 Artificial Analysis 排行榜上超越 Claude Fable 5。性能接近 Fable 5 但价格仅为其一半。在 Frontier-Bench 任务中,Opus 5 自主编写计算机视觉流水线,从像素图重建 3D FreeCAD 模型。在发现漏洞方面接近 Mythos 5,但未训练漏洞利用能力。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 性能接近 Fable 5 还便宜一半,能自己写代码做 3D 重建,很强。原文稍后读已读值得跟进有用关注 Claude Opus 5
06:45官方账号Perplexity@perplexity_ai72°Claude Opus 5 现已在 Perplexity 和 Perplexity Computer 上可用。Perplexity 将其与另外六个模型在 WANDR 基准上进行了评估。Claude Opus 5 表现优于除 Fable 5 外的所有模型,同时成本比这些模型平均低 57%。AI模型Claude Opus 5PerplexityWANDR10 个信源在谈事件专题推荐理由:Perplexity 上了 Claude Opus 5,WANDR 跑分只输 Fable 5,价格还便宜一半多,可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
06:36Claude@claudeai71°在ARC-AGI-3基准上,Opus 5的得分是次优模型的3倍。该基准测试AI模型解决全新问题的能力,共包含400道题。Opus 5在多项类人推理指标上表现突出。AI模型Opus 5ARC-AGI-3推理模型10 个信源在谈事件专题推荐理由:Opus 5在ARC-AGI-3上得分碾压其他模型,证明它的泛化和推理能力很强。原文稍后读已读值得跟进有用关注 Opus 5
05:17Jerry Liu@jerryjliu0据观察,Claude Opus 5 的系统卡显示,在大约20-30%的已报告基准测试中,采用最大思考模式相比xhigh模式导致性能下降。通常增加思考时间和测试时计算会提升性能,但这些结果推翻了这一假设。这可能是小模型的自然涌现属性或后训练环节的问题。AI模型Claude Opus 5推理模型基准测试推荐理由:有人发现 Opus 5 开最大思考反而在某些基准上变差了,和直觉相反,值得研究。原文稍后读已读值得跟进有用关注 Claude Opus 5
05:06ollama@ollamaOllama 发布消息称,由于 GLM-5.2 等前沿开放模型在其云平台上需求激增,公司正在增加计算容量以应对流量。为了维持基础设施的响应速度,Ollama 决定暂时停止接受 Max 计划的新订阅。现有 Max 用户不受影响,而 Pro 计划仍开放新订阅。Ollama 还透露将在下周上线一些非常大的模型。AI产品OllamaGLM-5.2模型部署推荐理由:Ollama 说 GLM-5.2 太火了,怕服务慢,先暂停 Max 新订阅。Pro 还能买,下周还有大模型上线,想用的话赶紧。原文稍后读已读值得跟进有用关注 Ollama
03:36Patrick Loeber@patloeber79°Anthropic 推出 Claude Opus 5,官方称其智力水平接近 Fable 5,但定价仅为后者的一半。该模型还降低了提示缓存最低门槛,有助于优化开发者成本。发布同时基础设施建设同步推进,提升了响应效率。AI模型Claude Opus 5Fable 5Anthropic10 个信源在谈事件专题推荐理由:Anthropic 新模型 Opus 5 性价比超高,接近 Fable 5 能力但价格砍半,缓存优化也实打实省钱。原文稍后读已读值得跟进有用关注 Claude Opus 5
03:00宝玉@dotey79°Anthropic 发布 Claude Opus 5,API 价格每百万输入 Token 5 美元、输出 25 美元,与 Opus 4.8 相同,仅为 Fable 5 的一半。Frontier-Bench v0.1 上得分是 Opus 4.8 的两倍多,单任务成本更低。CursorBench 3.2 最高 Effort 档下与 Fable 5 差距不到 0.5%,任务成本仅一半。ARC-AGI 3 得分是第二名模型的三倍,Zapier AutomationBench 在相同成本下任务通过率约为第二名的 1.5 倍。安全方面自动行为审计失准得分 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5。AI模型Claude Opus 5Fable 5Anthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 性能直逼旗舰 Fable 5,价格只要一半,多个基准全面碾压 Opus 4.8,开发者可以立刻用上。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:58AI SDK@aisdk72°Anthropic 发布 Claude Opus 5,这是一款思考型主动型模型,现已通过 AI SDK 可用。其智能水平接近 Fable 5,但价格仅为 Fable 5 的一半。该模型在推理和主动规划等任务上表现突出。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 性能接近 Fable 5,价格却只要一半,想省钱又不想降性能的可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:55官方账号Decoder@Matthias Bastian74°Anthropic推出了旗舰模型Claude Opus 5,在编码和知识工作基准上取得高分。该模型在ARC-AGI-3(评估新颖问题解决能力的基准)上达到30.2%,几乎是GPT-5.6 Sol的四倍。其token价格仅为Fable 5的一半。AI模型Claude Opus 5Fable 5GPT-5.6 Sol10 个信源在谈事件专题推荐理由:Anthropic的新模型Opus 5在推理和编程上很强,价格只有Fable 5一半,性价比高。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:53cat@_catwu76°Anthropic 推出 Claude Opus 5,定位为“ thoughtful and proactive”模型。官方宣称其前沿智能水平接近 Fable 5,但价格仅为后者一半。该模型擅长长时间自主工作,适合复杂任务场景。AI模型Claude Opus 5ClaudeFable 510 个信源在谈事件专题推荐理由:Claude Opus 5 价格只有 Fable 5 的一半,性能差距不大,适合预算有限又想要前沿能力的团队尝试。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:48Guillermo Rauch@rauchgVercel 宣布 Claude Opus 5 已在其 AI Gateway 平台上可用,并新增快速模式支持。相比前代 Opus 模型,Claude Opus 5 在智能体编程任务和低推理努力级别下的输出质量均有提升。该模型通过 Anthropic 的 API 提供服务,Vercel 用户可直接在 Gateway 中调用。AI模型Claude Opus 5VercelAI Gateway10 个信源在谈事件专题推荐理由:Vercel 把 Claude Opus 5 集成进了 AI Gateway,还加了快速模式,编程和低推理成本场景下比上一代 Opus 更强。想用最新 Claude 写代码的可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:38Alex Albert@alexalbert__81°Anthropic发布Claude Opus 5模型,定位为深思熟虑且主动的助手。官方称其智能水平接近Fable 5,但推理成本仅为后者的一半。该模型在x平台由Alex Albert推文首次公开。目前尚未披露具体基准跑分及开放渠道。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic新出的Claude Opus 5,据说能力逼近Fable 5,价格只要一半,性价比很能打。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:35Gary Marcus@GaryMarcus71°Anthropic 推出 Claude Opus 5,称其智能接近 Fable 5 的水平但定价仅为后者的一半。该模型定位为思考更主动的前沿模型,在多项基准测试中表现接近行业顶尖。这一降价策略延续了 Gary Marcus 2023 年预测的价格战趋势。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Anthropic 用半价拿出了接近 Fable 5 的模型,性价比拉满,想省钱又想要顶配可以看看。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:31The Rundown AI@therundownai81°Anthropic推出了Claude Opus 5,相比前代Claude 4.8有大幅提升。在多个基准测试中,Opus 5击败了竞争对手Fable。其定价仅为Fable的一半,性价比显著。该模型现已通过API提供。AI模型Claude Opus 5AnthropicFable10 个信源在谈事件专题推荐理由:Anthropic刚发Claude Opus 5,性能比4.8强不少,还在测试中赢了Fable,价格却只要一半,值得关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:13Claude@claudeai82°Claude Opus 5是Anthropic最新发布的推理模型,定位为深思熟虑且主动的模型。其智能水平接近Fable 5,但价格仅为Fable 5的一半。该模型在复杂推理和主动辅助任务上表现突出,旨在以更低成本提供前沿AI能力。AI模型Claude Opus 5Fable 5推理模型10 个信源在谈事件专题推荐理由:Claude Opus 5用一半价格接近Fable 5的水平,性价比很高,适合希望体验前沿AI但预算有限的用户。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:11Claude@claudeai76°Opus 5 今日在所有付费计划和 Claude API 上线,定价与 Opus 4.8 相同。它是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型。此外提供 Fast 模式,运行速度约为默认的2.5倍。AI模型Opus 5AnthropicClaude Max10 个信源在谈事件专题推荐理由:Anthropic 发了 Opus 5,性能更强但没涨价,还有快2.5倍的加速模式,适合既要速度又要质量的人。原文稍后读已读值得跟进有用关注 Opus 5
02:00宝玉@dotey79°Claude Opus 5 API价格为每百万输入Token 5美元、输出Token 25美元,与Opus 4.8相同。在Frontier-Bench v0.1上成绩是Opus 4.8的两倍多,ARC-AGI 3得分达第二名模型三倍。使用最高Effort档时,CursorBench 3.2上它与最强模型Fable 5差距不到0.5%,任务成本仅一半。在OSWorld 2.0上,它用Fable 5三分之一成本即超越后者最佳成绩。Anthropic称其对齐程度最高,综合失准得分2.3,低于Opus 4.8、Sonnet 5和Fable 5。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Opus 5来了,价格没变但能力飙升,在多个基准上吊打旧款,编程和推理尤其强,还带自动降级和缓存优化。原文稍后读已读值得跟进有用关注 Claude Opus 5
01:57Alex Albert@alexalbert__78°Anthropic 发布 Opus 5 模型,在多个领域提升 token 效率的同时,进一步拉高了智能水平。团队投入大量工作优化该模型,使其在编码任务上表现优于 Fable 5。用户反馈使用体验流畅。AI模型Opus 5Fable 5推理模型10 个信源在谈事件专题推荐理由:Anthropic 新模型 Opus 5,token 更省、智商更高,写代码比 Fable 5 顺手,值得试试。原文稍后读已读值得跟进有用关注 Opus 5
01:54Cognition@cognition_labs精选FrontierCode 1.1 是 Cognition 发布的评估真实工程任务的基准,考核代码合并性和质量。Opus 5 在该基准上取得 63.6% 的分数,扩展测试通过率 69.6%,性能接近 Fable 5 而成本仅为后者的一半。在 Devin 环境中,Opus 5 在困难调试和根因分析任务上表现突出。AI模型Opus 5FrontierCode 1.1Devin10 个信源在谈事件专题推荐理由:Opus 5 在代码工程基准上接近顶级模型,但价格只要一半,做调试分析特别强。原文稍后读已读值得跟进有用关注 Opus 5
01:53官方一手歸藏(guizang.ai)@op7418Claude Opus 5 已发布,定价与 Opus 4.8 相同。在多项基准测试中,Opus 5 成绩大幅优于 Opus 4.8,并且多数测评成绩高于 Fable 5。官方称其智能接近 Fable 5,但价格为 Fable 5 的一半。用户反馈该模型可用性明显提升。AI模型Claude Opus 5Opus 4.8Fable 510 个信源在谈事件专题推荐理由:Opus 5 性能强于 4.8,价格不变,还接近 Fable 5 但便宜一半,值得升级。原文稍后读已读值得跟进有用关注 Claude Opus 5
01:24elvis@omarsar076°Anthropic推出Claude Opus 5,定价为Fable 5的一半。该模型在token效率上显著改进,接近Fable 5的边界智能水平。它被设计为更主动和善于思考的模型,兼顾前沿能力与成本可负担性。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Claude Opus 5价格只有Fable 5的一半,token效率更高,适合想要前沿智能又不想花大钱的用户。原文稍后读已读值得跟进有用关注 Claude Opus 5
00:35官方账号Sam Altman@samaEthan Mollick 指出 GPT-5.6 Pro(仅聊天机器人可用)是目前最智能的模型。GPT-5.6 Ultra(Codex 中的最佳模型)在困难任务上表现较弱。对于真正难题,排名为:GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。模型命名令用户困惑。AI模型GPT-5.6CodexFable 510 个信源在谈事件专题推荐理由:OpenAI 的模型命名越来越绕了,看看 E 教授的实测对比,帮你搞清 GPT-5.6 各版本谁最强。原文稍后读已读值得跟进有用关注 GPT-5.6
22:00IT之家(博客/媒体)蚂蚁集团百灵大模型发布Ling-3.0-flash混合推理模型,总参数量124B,激活参数仅5.1B。采用原生混合线性注意力架构(5:1交替堆叠KDA与MLA)及1/64稀疏MoE,能力对标上一代1T旗舰Ring-2.6-1T。在长上下文、Agent等场景下实现性能越级,长输入TTFT降低60%至80%+。目前已开放限时免费API调用至8月3日,之后将开源模型权重。AI模型百灵Ling-3.0-flash蚂蚁集团推荐理由:蚂蚁新出的Ling-3.0-flash用124B参数(仅激活5.1B)就打平了1T的旗舰模型,还能支撑复杂Agent任务,现在免费试用,8月3日后开源,别错过。原文稍后读已读值得跟进有用关注 百灵
14:08@koltregaskes@koltregaskes一篇X帖子要求OpenAI在Codex中提供GPT-5.6 Pro。发帖者指出Ultra并非推理层级,而是使用High推理或混合模式,并运行子智能体而非单一智能体。Claude的Ultracode类似但采用动态工作流。Max是最高推理层级,默认隐藏。行业GPT-5.6 ProCodexOpenAI10 个信源在谈事件专题推荐理由:OpenAI的Codex缺了GPT-5.6 Pro,而且Ultra和Max的概念容易混淆。看看这位用户怎么说。原文稍后读已读值得跟进有用关注 GPT-5.6 Pro
13:09Ethan Mollick@emollickEmollick 指出,GPT-5.6 Pro(仅通过聊天机器人可用)是当前最智能的模型。GPT-5.6 Ultra(Codex 中的最佳模型)在困难任务上表现不如 Pro。对于极难问题,性能排序为 GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。这一命名体系让用户难以区分。AI模型GPT-5.6 ProGPT-5.6 UltraFable 5 Ultracode1 个信源在谈事件专题推荐理由:Emollick 实测对比了 GPT-5.6 系列和 Fable 5,告诉你哪个版本才是真正的推理之王,别再被名字骗了。原文稍后读已读值得跟进有用关注 GPT-5.6 Pro
11:29官方账号arXiv cs.AI@Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma论文发现视觉语言模型在几何推理中,对文本、图像和图文组合三种视图的推理结果不一致。为此构建了ODA-Data多视图几何数据集,并提出了MIRROR强化学习方法。MIRROR通过评估模型在各视图下的表现,选择最佳视图作为教师,用反向KL散度训练其他视图。在多个几何推理基准上,MIRROR比标准RL提高了准确性和模态间一致性。论文MIRRORVLM多模态推理推荐理由:这篇论文提出了MIRROR方法,让视觉语言模型通过不同视角互相学习,在几何推理中表现更稳定、更准确。原文稍后读已读值得跟进有用关注 MIRROR