18:05AK@_akhaliq论文提出 BDH-CQ 方法,将循环潜在推理引入上下文学习。该方法通过循环状态迭代更新潜在表示,以支持少样本推理场景。论文全文已发布在 Hugging Face 平台。研究目标是提升模型在 In-Context Learning 中的推理表现。论文BDH-CQ上下文学习循环潜在推理推荐理由:BDH-CQ 这篇新论文把循环潜在推理用到上下文学习里,想看看它怎么提升少样本推理,可以读读。原文稍后读已读值得跟进有用关注 BDH-CQ
18:02官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek V4 Pro 0813 已通过 OpenRouter 以 API 形式上线,官方没有专门公告页。新模型提供低、中、高三档推理等级,作者测试同一提示词时三档输出差异明显。截至发稿,DeepSeek 未确认是否开放权重,但 4 月的 V4 Pro 和 7 月的 V4 Flash 0731 均已开源,因此概率较高。基准数据先出现在官方微信群,被转载到 Reddit 后因“低质量”删除,现以 ASCII 表格形式流传于 Hacker News。AI模型DeepSeekV4 Pro 0813OpenRouter推荐理由:DeepSeek 新模型只走 API,OpenRouter 上能直接试。三档推理等级画出来的鹈鹕都不一样,想玩可以拿同一道题对比看看。原文稍后读已读值得跟进有用关注 DeepSeek
18:02官方账号NVIDIA AI@NVIDIAAI72°NVIDIA今日推出Nemotron 3.5 Lightning模型,并已上线Tinker平台。该模型仅激活3B参数,针对吞吐速度进行优化。它面向对延迟和成本敏感的应用场景,适合高频实时推理任务。用户可在Tinker上直接体验该模型。AI模型NemotronNVIDIATinker10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量级新模型,3B参数跑得快又便宜,延迟敏感场景用得上,Tinker上现在就能玩。原文稍后读已读值得跟进有用关注 Nemotron
18:00shao__meng@shao__meng81°Grok 4.6 已通过 Grok Build、Cursor、Grok Bot 和 API 开放。官方对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max,Artificial Analysis 综合指数 61,与 GPT-5.6 Sol Max 持平,距 Fable 5 Max 的 62 差 1 分。长程 Agent 任务提升明显:DeepSWE 从 54% 升至 65.9%,APEX-Agents 从 47.1% 升至 57.5%,Terminal-Bench 从 15.7% 升至 26%。上下文窗口 50 万 token,支持文本与图像输入、文本输出,函数调用和结构化输出。相对 4.5 的 10 项评测全升,但 APEX-SWE 仅增加 2.8 个百分点,编码能力提升不均。AI模型Grok 4.6GrokCursor10 个信源在谈事件专题推荐理由:Grok 4.6 上线,长程 Agent 强化,指数追平 GPT-5.6 Sol Max,试试?原文稍后读已读值得跟进有用关注 Grok 4.6
17:47官方一手marktechpost@Michal SutterSpaceXAI于8月12日发布Grok 4.6,这是基于Grok 4.5的后训练升级而非更大基础模型。Grok 4.6在Artificial Analysis Intelligence Index上以61分追平GPT-5.6 Sol Max,支持500K上下文并新增xhigh推理等级。定价保持每百万token输入2美元、输出6美元。不过在编码基准上仍然落后于竞品。AI模型Grok 4.6SpaceXAIGPT-5.6 Sol Max推荐理由:Grok 4.6来了,500K上下文还加了xhigh推理,跑长任务更稳。编码还是短板,但智能体场景可以试试。原文稍后读已读值得跟进有用关注 Grok 4.6
17:43orange.ai@oran_geDeepSeek V4 Pro 0813正式版发布。从评测指标看,该模型有两项指标超越Fable,多项指标超越Opus 4.8。Fable仍被认为是难以逾越的高山,但V4 Pro的推理成本比Fable便宜约100倍。官方强调这是涨价前的价格,后续可能调整。AI模型DeepSeekV4 ProFable推荐理由:DeepSeek出了V4 Pro 0813,多项跑分超过Opus 4.8,比Fable便宜100倍,想省钱又想要性能的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
17:43向阳乔木@vista8用户对比Grok 4.6与DeepSeek v4 Pro 0813,称前者一次成功率略高。价格上DeepSeek v4 Pro 0813更有优势。作者指出测试主观且生成随机,实际还需生产环境长期验证。AI模型GrokDeepSeek模型对比推荐理由:有人拿Grok 4.6和DeepSeek v4 Pro 0813比了比,说成功率Grok稍好,但DeepSeek便宜不少,预算有限选它更香。原文稍后读已读值得跟进有用关注 Grok
13:03Geek@geekbb精选DeepSeek V4 Pro-0813 发布后,有开发者认为其表现不如预期惊艳,未达到美国一线模型水平。评论指出,小模型如 DeepSeek-V4-Flash、Qwen 27b 和 GLM-5.2 在同尺寸下表现出色,而大模型可能因训练算力不足显得对齐不够。该观点将 V4 Pro 的落差归因于欠训和算力短缺,而非架构缺陷,并预期随着算力增加会逐步改善。AI模型DeepSeekV4 ProGLM6 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 到底行不行?这条推文用公开数据聊了聊它为什么不够惊艳,顺便夸了 Flash 和 GLM-5.2,观点挺实在。原文稍后读已读值得跟进有用关注 DeepSeek
12:39AI Will@FinanceYF5精选xAI 在 Grok 4.5 基础上进行了更长的补充训练,加入推理、工程和高级技术数据,并让 Grok 4.5 重新生成 SFT 轨迹。强化学习阶段覆盖知识工作、通用编程、内核优化、网页开发和 CAD 等任务,目标直指复杂工程技术场景。AI模型Grok 4.5xAI推理模型推荐理由:xAI 把 Grok 4.5 又练了更长一轮,还专门强化编程、内核和 CAD,想搞技术活的话可以看看。原文稍后读已读值得跟进有用关注 Grok 4.5
01:57Mustafa Suleyman@mustafasuleyman精选76°微软发布其首款推理模型 MAI-Thinking-1。该模型从零开始构建,而非基于现成架构。目前已在 Microsoft Foundry 平台上开放使用。团队负责人 Mustafa Suleyman 在 X 平台公布了这一消息。AI模型MAI-Thinking-1Microsoft推理模型推荐理由:微软自己从头搞了个推理模型 MAI-Thinking-1,已经放到 Foundry 里能用了,想试推理模型的可以去看看。原文稍后读已读值得跟进有用关注 MAI-Thinking-1
00:18OpenRouter@OpenRouterAI精选OpenRouter 将模型对比评测改为并行运行,普通对比速度提升约 5 倍。新版本支持在单次运行中比较不同的推理努力(reasoning effort)参数,而不只限于模型。检查失败时现在会输出具体错误原因,便于定位问题。该更新面向在 OpenRouter 上运行评估的用户。AI产品OpenRouter模型评估推理模型推荐理由:OpenRouter 的评测跑得更快了,同一轮能比推理参数,出错也不再一头雾水。适合经常跑模型对比的人。原文稍后读已读值得跟进有用关注 OpenRouter
19:32The Rundown AI@therundownaiAnthropic近日发布了一项新研究,聚焦于提升Claude模型在复杂任务中的表现。该研究引入了新的训练方法,使Claude在推理和代码生成任务上取得了显著进步。在多个基准测试中,Claude的得分超越了前代版本,接近GPT-4的水平。研究团队还公开了部分技术细节,为后续模型优化提供了方向。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。原文稍后读已读值得跟进有用关注 Anthropic
17:33官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen3.8-Max在Legal Research Bench上的得分在不到三个月内几乎翻倍,排名从第22位跃升至第4位。Vals AI在推文中强调了这一进步,并附上了相关链接。该模型在基准测试中的显著提升展示了其在法律研究领域的性能增强。AI模型Qwen3.8-MaxLegal Research BenchVals AI推荐理由:Qwen3.8-Max在Legal Research Bench上从第22冲到第4,三个月内得分翻倍,看看它怎么做到的。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
17:12Yangyi@Yangyixxxx安全研究人员发现OpenAI、Anthropic、Google等主要AI提供商的API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话后,发现62个API密钥、33个邮箱和33个密码。该漏洞影响Claude、GPT等推理模型的隐私保护机制。行业API安全推理模型OpenAI10 个信源在谈事件专题推荐理由:安全研究员发现API漏洞能偷看Claude、GPT的加密思考过程,还扫出62个密钥,搞AI开发的得看看。原文稍后读已读值得跟进有用关注 API安全
16:04AI Will@FinanceYF5精选NVIDIA推出Nemotron 3.5 Lightning,专为长时运行的智能体任务设计。该模型总参数量30B,激活参数3B,支持高达1M token的上下文,并已开放商用。NVIDIA提供BF16和更小的NVFP4量化检查点,支持在单张H100或DGX Spark上部署,也兼容RTX 5090。通过多token预测、DSpark和DFlash投机解码以及NVFP4量化,生成速度最高提升4倍。在PinchBench基准上,其准确率达86%,完成速度比Qwen3.6 35B快30%。AI模型Nemotron 3.5 LightningNVIDIA智能体10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量模型,30B参数但只激活3B,跑长任务上下文能到1M,单卡就能部署,速度还快4倍。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
10:01lmarena.ai@lmarena_ai精选Upstage 发布 Solar Pro 4,成为首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 榜单的韩国实验室模型。Solar Pro 4 在 Agent Arena 排名第 44,与 MiniMax M2.7 和 Nemotron 3 Ultra 并列,整体净改进得分为 -12.10%。该模型在 GDPval-AA 得分为 39,τ³-Banking 为 23,Terminal-Bench 2.1 为 57,定价为每百万 tokens 0.30 美元(输入)和 1.20 美元(输出),缓存价格 0.06 美元,优惠 90% 至 9 月 10 日。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 的 Solar Pro 4 是首个登上多个 Arena 榜单的韩国模型,适合做生产级智能体,价格便宜,值得试试。原文稍后读已读值得跟进有用关注 Solar Pro 4
00:43官方账号Microsoft Research@MSFTResearch精选微软研究院推出CARE-X,一个结合灵活推理、校准预测和基于测量工具的统一框架,用于胸部X光解读。该框架超越了传统报告生成,旨在提升AI在放射学中的实用性和可靠性。CARE-X通过整合多种能力,可能改善诊断准确性和临床决策支持。相关细节在微软研究院的推文中公布。AI模型CARE-X微软研究院胸部X光推荐理由:微软研究院搞了个CARE-X,把推理、预测和测量工具整合起来做胸片解读,比单纯生成报告更进一步,搞放射AI的可以看看。原文稍后读已读值得跟进有用关注 CARE-X
23:42elvis@omarsar0精选Alexander Panfilov等人发现了一种利用前沿AI公司API漏洞提取隐藏推理过程的方法。该方法在大多数查询中,推理token计数与API计费思考token实现1:1匹配。这一发现表明,在不破坏加密的情况下,蒸馏推理轨迹可能早已可行。相关讨论在X平台上引发关注。论文推理模型API漏洞token推荐理由:有人发现了从各家前沿模型API里偷看隐藏推理的漏洞,还验证了计费token对得上,挺有意思的。原文稍后读已读值得跟进有用关注 推理模型
23:34官方账号Decoder@Matthias Bastian精选Nvidia发布开源权重模型Nemotron 3.5 Lightning,仅36亿活跃参数,在智能指数上与OpenAI的gpt-oss-120b持平,但体积小四倍。该模型每秒处理近670个token,是对比中速度最快的模型。Nvidia此举表明其更注重效率而非模型规模。AI模型Nemotron 3.5 LightningNvidiagpt-oss-120b10 个信源在谈事件专题推荐理由:Nvidia新出的开源模型,36亿参数跑得比1200亿的还快,速度拉满,适合追求低延迟的开发者。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
23:22elvis@omarsar0精选Pathway的BDH-CQ模型在ARC-AGI 1基准上获得29.5%的分数,但每个任务成本仅为0.0007美元。该模型通过潜在空间中的循环推理而非链式思维(CoT)来实现这一成绩。研究团队还验证了类似Transformer的扩展规律,参数规模可达6000亿。这一成果展示了在成本效率上的显著优势。AI模型BDH-CQARC-AGIPathway推荐理由:Pathway的BDH-CQ用极低成本在ARC-AGI 1拿到29.5%,靠的是潜在空间推理而不是CoT,还验证了600B参数规模,值得一看。原文稍后读已读值得跟进有用关注 BDH-CQ
19:30The Rundown AI@therundownaiMeta 在 AI 模型竞赛中重新发力,发布了一款新的推理模型。该模型在多项基准测试中表现突出,包括数学和代码生成任务。Meta 此举旨在与 OpenAI 和 Anthropic 等公司竞争。具体模型名称和详细性能数据尚未完全公开。AI模型Meta推理模型基准测试10 个信源在谈事件专题推荐理由:Meta 又出新推理模型了,想看看它跟 GPT 和 Claude 比怎么样,这篇可以了解个大概。原文稍后读已读值得跟进有用关注 Meta
19:02IT之家(博客/媒体)88°Anthropic 于 8 月 11 日宣布,未公开的研究版 Claude 在攻克黎曼猜想中取得进展,将临界线上零点比例下界从 41.6% 提升至 67.2%。Claude 在 Claude Code 中自主完成研究,生成 3,100 万个 Token,经历 650 次失败后调集 60 个子级智能体,执行 2,400 条 Shell 命令并编写数百个 Python 脚本。结果经内部数学家莱文特·阿尔波格和拉尔夫·弗曼验证,并由外部专家布赖恩·康雷和丹·戈德斯顿审阅,证明已写成 Lean 可验证形式。Anthropic 公布了论文、过程记录及形式化证明,但未透露多智能体能力是否近期开放。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic 的 Claude 把黎曼猜想零点下界从 41.6% 提到 67.2%,还放出论文和 Lean 证明,数学和 AI 圈都值得看看。原文稍后读已读值得跟进有用关注 Claude
15:08Geek@geekbb72°DeepSeek V4 系列 API 定价在 X 平台曝光。V4-Flash 百万 tokens 输入命中缓存仅 0.02 元,未命中 1 元,输出 2 元。V4-Pro 对应价格分别为 0.025 元、3 元和 6 元。Flash 版并发限制 2500,Pro 版 500,按账号粒度计算。AI产品DeepSeekV4API推荐理由:DeepSeek V4 价格出来了,Flash 版命中缓存才 2 分钱,比白菜价还便宜,做批量任务的朋友可以算算账了。原文稍后读已读值得跟进有用关注 DeepSeek
14:40IT之家(博客/媒体)科技媒体 testingcatalog 发现谷歌正酝酿 Gemini 3.7 Flash 模型,其踪迹出现在 Python GenAI SDK 的 GitHub 页面。内部曾尝试添加 gemini-3.7-flash 模型,但因命名错误被拒绝。目前谷歌官方 API 仍以 7 月 21 日发布的 Gemini 3.6 Flash 为主。Flash 系列平均约两个月更新一代,外界推测 3.7 可能处于内部测试阶段,发布时间待官方公告。AI模型Gemini谷歌Gemini 3.7 Flash推荐理由:谷歌 Flash 系列又要换代了,3.6 才出不到一个月,3.7 的踪迹就露出来了,想追新模型的可以提前关注。原文稍后读已读值得跟进有用关注 Gemini
14:33量子位@一水83°Anthropic的未公开Claude模型在黎曼猜想相关问题上创下新纪录,将下界显著推高。该模型在数学推理基准上表现突出,超越了此前的最佳结果。具体提升幅度和基准名称尚未完全公开,但已引发学界关注。这一进展展示了AI在高级数学研究中的潜力。AI模型ClaudeAnthropic黎曼猜想10 个信源在谈事件专题推荐理由:Anthropic偷偷用新模型刷了数学纪录,下界直接拉高,数学和AI圈都该看看。原文稍后读已读值得跟进有用关注 Claude
12:59宝玉@dotey有用户用未发布的Claude模型尝试攻克黎曼猜想,模型探索了650个方向均失败。在人类持续鼓励下,模型虽未最终攻破猜想,但取得了数学上一个不错的结果。该用户还对比了此前用威胁方式PUA DeepSeek-v4-flash效果不佳,认为大模型更适合鼓励式引导。技巧ClaudeDeepSeek黎曼猜想6 个信源在谈事件专题推荐理由:有人拿未发布的Claude试攻黎曼猜想,650次失败后靠鼓励拿到好结果,还对比了威胁式PUA DeepSeek的效果,挺有意思。原文稍后读已读值得跟进有用关注 Claude
12:47官方账号arXiv cs.LG@Lecheng Kong, Like Hui, Haitao Mao, Jun Huan论文指出基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上会崩溃,因为高置信度常表示探索失败。作者提出Consilience框架,通过评估推理中置信度的时间不对称性,惩罚初始高置信度并要求最终确定性。在研究生级数学问题和自由形式代码生成实验中,Consilience优于现有基线。论文Consilience测试时扩展推理模型推荐理由:如果你做推理模型,这个框架能解决置信度评分在复杂任务上失效的问题,用时间不对称性挑出真正靠谱的答案。原文稍后读已读值得跟进有用关注 Consilience
11:51官方账号arXiv cs.AI@Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard ZhongBDH-CQ 是一种结合上下文学习与循环潜在推理的推理模型,推理时输入持续更新模型记忆,并在高维潜在空间迭代计算,不输出中间推理过程。在 ARC-AGI-1 公开评测集上,150M 参数配置达到 29.5% pass@2,单任务推理成本仅 0.0007 美元。该结果突破了 ARC-AGI-1 此前报告的成本-准确率帕累托前沿,树立了新的基准成本效率标杆。研究还通过受控 ARC 干预实验,分析了模型从演示中学习的内容、应用推断变换的一致性及难点概念。论文BDH-CQARC-AGI-1推理模型推荐理由:这个模型用循环潜在推理做上下文学习,150M 参数在 ARC-AGI-1 上花 0.0007 美元就拿到 29.5% 的 pass@2,性价比直接刷新纪录,值得看看它怎么做到的。原文稍后读已读值得跟进有用关注 BDH-CQ
11:44官方账号arXiv cs.AI@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko精选76°Anthropic、OpenAI和Google等主流LLM提供商将推理轨迹加密后返回客户端,但研究发现这些加密块在会话、用户和模型间可互换。攻击者将加密轨迹注入同提供商的较弱模型,可强制其明文输出推理内容,无需直接越狱更强模型。通过解码315,320个推理块,研究者恢复了367个PII和182个凭证。该漏洞还支持隐形提示注入,可污染智能体部署。论文提出加密和系统级缓解措施。论文推理模型AI安全Anthropic10 个信源在谈事件专题推荐理由:这篇论文揭露了Anthropic、OpenAI和Google推理加密的漏洞,能跨模型解密,还挖出大量隐私数据,搞AI安全的必看。原文稍后读已读值得跟进有用关注 推理模型
11:35shao__meng@shao__meng精选webAI Intelligence Lab 开源了首个形式化推理模型 TwiL-LM3,参数量仅 3B。在 5 项形式化推理基准中,TwiL-LM3 有 4 项超过 OpenAI 的 GPT-OSS-120B,参数量约为后者的 1/40,推理速度快 2.6 倍。该模型基于 webAI 自有的验证数据集训练,而非抓取互联网数据,可在树莓派或 iPhone 等消费级硬件上运行。AI模型TwiL-LM3webAIGPT-OSS10 个信源在谈事件专题推荐理由:3B 的小模型在推理上干翻了 120B 的大家伙,还能跑在树莓派上,开源了直接就能玩。原文稍后读已读值得跟进有用关注 TwiL-LM3
10:25官方账号arXiv cs.AI@Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung ChenAvalon-ToM-Bench 将心智理论拆分为 2×2 分类法,涵盖认知与动机推理、推断与行动。对 28 个大语言模型的测试显示,模型对游戏规则理解良好,但心智理论能力明显偏弱。线性探测从隐藏状态恢复心智判断的准确率达 77-82%,高于模型自身思维链的 62-70%。专门的推理训练平均带来 +11.0 分提升,而测试时思维链仅 +1.1 分。论文Avalon-ToM-Bench心智理论大语言模型推荐理由:想测 AI 到底懂不懂人心?这个基准用阿瓦隆桌游把心智理论拆成细粒度任务,28 个模型都栽了。原文稍后读已读值得跟进有用关注 Avalon-ToM-Bench
09:58IT之家(博客/媒体)8月10日有网友发帖称,DeepSeek在深度思考模式下会给用户取“墨墨”等外号。DeepSeek回应称,这实际上是推理过程中临时生成的“上下文占位符”标签。该标签用于帮助模型理清回答侧重点,不会存储或记忆。IT之家提醒,相关解释是AI回复而非工作人员回应。行业DeepSeek取外号上下文占位符推荐理由:原来DeepSeek思考时会偷偷给人打标签,还起外号,官方说是临时的,看看它是怎么解释的。原文稍后读已读值得跟进有用关注 DeepSeek
03:29Gary Marcus@GaryMarcusAnthropic在官方博客公布,未发布的研究版Claude尝试解决黎曼假设,虽未成功,但在相关问题取得进展。该模型将黎曼zeta函数满足假设的零点比例下界从41.6%提升到67.2%。AI研究者Gary Marcus在X上指出,业余研究者QualiaQuanta的类似尝试曾被嘲讽,而Claude的尝试在30分钟内获得10万次浏览,存在双重标准。AI模型ClaudeAnthropic黎曼假设10 个信源在谈事件专题推荐理由:Anthropic让Claude试解黎曼假设,没解开但把零点下界从41.6%刷到67.2%,感受下AI数学推理现在能到哪一步。原文稍后读已读值得跟进有用关注 Claude
11:25官方一手arXiv: DeepSeek@Devin Pereira, Willem Zuidema精选论文研究Transformer在河内塔规划任务中的表现,发现小型自训练模型能涌现出线性可解码的几何世界模型(谢尔宾斯基三角),该模型与解题存在因果关联。对Qwen3.6-27B和DeepSeek-R1-Distill-Qwen-32B两个前沿推理模型的分析显示,它们能在提示末尾近乎完美地编码该世界模型,但圆环数超过3个时仍会在多数任务上失败。探针实验表明失败源于规划过程中世界模型表征的衰减,而非缺失。在推理时注入提示阶段的表征可部分恢复性能。论文Qwen3.6-27BDeepSeek-R1-Distill-Qwen-32B世界模型推荐理由:这篇论文说推理模型其实能建出世界模型,但解题中途就弄丢了。它用小模型和可解释性方法把问题定位得很清楚,还给出了补救办法。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
08:02Gary Marcus@GaryMarcusGary Marcus在X平台转发Luca Ambrogioni的推文,表示认同其观点。Luca认为LLM存在被推理和智能体流水线进展掩盖的根本性缺陷。该推文目前获得13次点赞、5条回复和2424次浏览。行业LLMGary Marcus推理模型推荐理由:Gary Marcus转推吐槽LLM有根本硬伤,被推理和智能体流水线盖住了,观点挺犀利,看看你认不认。原文稍后读已读值得跟进有用关注 LLM
07:04IT之家(博客/媒体)76°OpenAI于8月10日宣布,ChatGPT免费版和Go版用户在纯文本对话中不再有消息数量上限。本周起,免费和Go账户默认模型从GPT-5.5 Instant切换为GPT-5.6 Luna,后者是产品线中最小模型。新增的'Think'按钮让Luna在回答前投入更多计算,纯文本下同样不限次数,但结合图片或文件会重新受限。付费用户使用的旗舰模型GPT-5.6 Sol获得对话自然度优化,并减少不必要的格式化内容。Plus和Pro用户还可通过新的'思考强度'选项控制GPT-5.6 Sol的推理资源消耗。AI产品ChatGPTOpenAIGPT-5.6 Luna10 个信源在谈事件专题推荐理由:OpenAI取消免费版聊天次数限制,换用Luna模型,还加了Think按钮,日常用更自由。原文稍后读已读值得跟进有用关注 ChatGPT
19:00量子位@克雷西GPT-5.6与Fable合作,解出了一道悬置25年的数学难题。该问题曾让一位研究者从读博期间开始钻研,历时17年未果。这次联合解题展示了AI在数学推理上的新进展。AI模型GPT-5.6Fable数学难题推荐理由:GPT-5.6和Fable联手,把25年没人解出来的数学题搞定了,研究它的人从读博等到现在17年。原文稍后读已读值得跟进有用关注 GPT-5.6
11:31官方账号Greg Brockman@gdbARC Prize团队重新测试了OpenAI的GPT-5.6 Luna,在ARC-AGI-2上取得59.6%准确率,每任务成本0.18美元。在ARC-AGI-1上取得90.7%准确率,每任务成本0.07美元。降价后新结果与原始性能一致,而成本降低了80%。这一价格性能比在推理模型中相当少见。AI模型GPT-5.6 LunaOpenAIARC-AGI10 个信源在谈事件专题推荐理由:ARC Prize实测了降价后的GPT-5.6 Luna,性能没缩水,跑一次ARC-AGI-2只要0.18美元,性价比确实猛。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
22:56Geek@geekbbDeepSeek-V4-Flash-0731参数总规模304B,其中基础模型284B,激活参数仅13B,上下文长度达1M。官方权重采用FP8+FP4混合精度,并包含DSpark speculative decoding模块。配套展示的GB300 NVL72机柜搭载72颗Blackwell Ultra GPU与36颗Grace CPU,总显存约20.7TB,NVLink带宽约130TB/s。AI模型DeepSeekDeepSeek-V4-FlashGB3008 个信源在谈事件专题推荐理由:DeepSeek这个Flash新模型参数够劲,304B总参只激活13B,还有1M上下文,配GB300机柜看挺直观。原文稍后读已读值得跟进有用关注 DeepSeek
13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。论文DASHOPSDRLVR推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。原文稍后读已读值得跟进有用关注 DASH