Meta 终于入局智能体赛场,Muse Spark 1.1 一上榜就拿第五,还开放了 API 和思考模式,想试试新模型可以冲。
#推理模型
OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。
这篇论文提出了EYT-Bench,能更真实地测出LLM在多轮对话中的意图追踪能力。用16/17模型发现推理模式大幅提升长上下文准确率,值得关注。
想快速了解本周最强AI模型?Arena周榜给出硬核排名:代码能力claude-opus-4-7-thinking超了claude-fable-5,国产qwen3.7也稳在Top20。
想在不重训模型的情况下让扩散模型生成更多样化的结果?这篇论文给出了一个简单有效的技巧:温度采样配合时间偏移,在DiT、Stable Diffusion上都有效果。
这篇论文把OPSD训练时模型思维崩溃的原因和解决方法都讲清楚了,AD-OPSD在数学题上能提4个点,做推理优化的值得看看。
GPT-5.6 Sol Ultra 又解了一个 Erdős 难题 #793,构造比原方法更短更优雅,数学推理让人眼前一亮。
Hugging Face 把 Transformers 模型直接跑进 vLLM,性能不输手写,以后搞推理不用重复造轮子了。
OpenAI 最强模型 GPT-5.6 系列直接上架 AWS,现在在 Bedrock 就能用,省去自己部署的麻烦,三个版本各有特色,性能很强。
DeepSeek 的 DSpark 投机解码,能让 Kimi-K2.6 和 K2.7-Code 一次生成整块 token,配合 vLLM 0.25.0 原生支持,解码更快。
GLM 5.2 在 Together AI 上跑出了最快速度和最低延迟,想用低成本跑推理的话可以去试试这个组合。
OpenAI 的 GPT-5.6 Sol Ultra 只用一小时就搞定了一个困扰数学家 50 年的图论难题,用的是 64 个子智能体协作,比人类更有耐心反复试错。
OpenAI的GPT-5.6 Sol Ultra一小时破解了困扰数学界50年的Cycle Double Cover猜想,虽被指引用不足,但效率惊人。
GPT-5.6 Sol在Codex里花了5小时自己打穿了Slay the Spire 2每日挑战,这自主性有点强啊。
GPT-5.6 用 700 词 Prompt 指挥 64 个小模型,一小时破解了数学家 50 年没解开的难题,推理能力强到离谱。
OpenAI 刚发了 GPT-5.6,三个型号性能都爆表,尤其 Sol 在编码和推理测试里吊打 Claude Fable 5,成本还低很多,编程和复杂任务都更强了。
如果你用 GPT-5.6 写代码,可以试试 Sol medium,比 5.5 xhigh 更好用,别被复杂的选项吓到。