腾讯的Hy3模型现在OpenRouter上就能用,295B参数但只激活21B,成本低,还有三种推理模式,做智能体任务很合适,而且免费到7月21号,赶紧试试。
想给模型推理提速?这个ThinkingCap把Qwen 27B的思考token砍掉一半,有的例子快10倍,效果还很稳定。
Bleys 算了一笔账:GPT-5.6 Sol 参数 2-4 万亿、跑在 Cerebras 晶圆上、速度 750 token/s,但价格可能翻倍。想了解下一代超大规模模型怎么造?看这个。
OpenAI 把 GPT-5.6 Sol 放到 Cerebras 上跑,推理速度飙到 750 tokens/s,比常规部署快很多,适合追求低延迟的场景。
Marc Andreessen 直接评价说 DeepSeek 的 Fable 可能已经接近 AGI 的门槛,这个判断来自顶级投资人,值得关注。
Anthropic发现Claude有个隐藏的“思考空间”J-space,模型能在里面默默推理,不写出来。删掉它复杂推理就变差,还能看到模型私下的想法,挺有意思。
想做机器人深度估计?LingBot 团队开源了视觉基础模型和深度模型,误差直接减半,还拿下了12个基准的第一。
bottlecapai 用 Qwen3.6-27B 微调的新模型能省一半推理 token,最快省九成,适合低成本推理场景。
Kyutai Labs开源了MIRA,一个在神经网络里直接跑《火箭联盟》的模型,5B参数、20fps,不用游戏引擎纯靠学习生成,比传统游戏模拟器有意思多了。
SGLang加入DSpark后,高并发场景下吞吐能提升20%,在DeepSeek-V4上实测383.7 tok/s,推理优化党可以试试。
腾讯混元新模型Hy3,21B激活参数就能比肩更大模型,幻觉率从12.5%降到5.4%,多轮对话能力大增,现在就能在SGLang上跑。
MistralAI 的 Leanstral 1.5 用 6B 活跃参数就拿下 miniF2F 满分,每个问题才 4 美元,做数学证明的可以试试。
NVIDIA在ICML 2026上刷了一波存在感:145篇论文用上Nemotron,74篇自家论文入选,还有2000篇靠NVIDIA GPU跑出来的。学术圈地位一览无余。
DeepSeek V4的周Token量干到了6.6T,超过Anthropic,也甩开其他国产模型。想直观对比模型热度?OpenRouter这组数据很说明问题。
Armin 用实际 bug 案例拆解了 Claude 新模型在工具调用上的奇怪倒退,解释了为什么更强的模型反而更不听话,读起来很爽。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。