#推理模型
Google DeepMind 的 Benoit Schilling 分享了AI编程的新阶段:难点不在写代码,而在设计对齐。他亲自领导 Gemini 的推理和编程团队,观点很实在。
Grok 4.5被用户吹爆,说它又快又便宜还能干复杂活,甚至能逆向Codex。如果你想要个干活利索、不磨叽的模型,可以试试它。
华为发布了昇腾950超节点,1024卡规模,1 EFLOPS算力,专为万亿参数大模型训练设计;384超节点已商用750套,落地案例丰富,值得关注。
Ubuntu 说这个内核版本让 AMD 显卡跑 AI 慢 42 倍,SDXL 推理从 9 秒变成 388 秒。如果你在用 Ubuntu,赶紧看看内核版本号。
新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。
他们搞了个叫 Schema 的 harness,让 AI 学物理学家那样思考,直接刷爆 ARC-AGI-3 基准,挺有意思的。
Lila Sciences的两位高管聊了个大胆想法:把实验室当数据中心用,用10万亿实验token训练AI,跨学科搞推理,比单纯刷题更有价值。
Moonshot发了2.8万亿参数Kimi K3,前端代码超越Fable 5,开放权重版月底就能用,价格虽高但看齐Claude Sonnet。
Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了
Thinking Machines 发了 Inkling,一个能看图文听音频的推理模型,而且权重全开放,能自己微调,还能在 Playground 试玩。
想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。
GPT-5.6 智商飙到 136 分,比 Claude-5 还高出一截,而且干活也不含糊,一句话就能造出应用,值得看看它到底多强。
这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
Inkling 让你能控制模型思考深度,975B 参数但只激活 41B,适合做定制化基础模型。
Allen AI 用研究者投票测了 AI 的科学文献能力,1700 人投了 3900 票,想看看哪个模型更靠谱?这里直接给结果。
这篇论文深挖了一个漏洞:计划评估器可能因为计划含糊就给高分。他们用数学证明并在26条路线上验证了。搞LLM安全或评估的值得一读。
这篇论文用实验告诉你,视觉语言模型做CoT推理时,图像其实只在开头看一次,后面全靠语言处理。想知道为什么CoT有时没用?进来看看
Qwen3微调模型在化学机理推理上直接击败了专用FlowER,准确率从5.1%提升到8.3%,化学和AI交叉领域值得一看。
这论文搞了个叫EG-VAR的框架,用Lean内核做形式化验证,让LLM的推理结果100%可追溯,在TableBench上满分,比普通工具调用靠谱太多了。
Meta 终于入局智能体赛场,Muse Spark 1.1 一上榜就拿第五,还开放了 API 和思考模式,想试试新模型可以冲。