#推理模型
腾讯新出的 Hy3 模型 295B 参数,256K 上下文,现在 OpenRouter 上免费到月底,编码和推理都很强,赶紧去试试。
各家疯狂出新模型,OpenAI今天正式发GPT-5.6,谷歌的Gemini 3.5 Pro快了,中国也有新动作,竞争太激烈了。
蓝戟实测发现 Intel Arc Pro B70 跑 DeepSeek R1 推理比 RTX 5090D 还快,高并发场景优势明显,适合做推理部署参考。
OpenAI 出了 GPT-Live,能边听边和你对话,遇到难题自动调 GPT-5.5,还能实时显示卡片,比 Siri 强多了。
这篇论文发布了SciReasoner,一个能同时处理蛋白质、小分子和晶体的推理模型,在67项基准上成绩最好,专家评价也很高。
这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。
Cognition 新模型 SWE-1.7 基于 Kimi K2.7 用强化学习改进,FrontierCode 基准上 42.3% 分且每任务仅 1.97 美元,性价比突出。
Cognition 用更长的训练让 SWE-1.7 学会先思考再动手,但代码改动的范围也变大了——这个权衡挺有意思,做 AI 编程助手的可以看看。
开源模型DeepSeek V3.2套上智能体架构,在ARC推理任务上以不到1美元成本拿下67%准确率,比零样本强了50多个点,硬件开销很低。
腾讯开源了 Hy3,295B 参数只有 21B 激活,推理和智能体能力很强,还支持 256K 上下文,现在调用太多刚扩容完。
英伟达开源模型 Nemotron 3 Ultra 在智能体测试中准确率最高,成本只有闭源模型的十分之一,适合想低成本构建企业智能体的团队。
OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
OpenAI 的 GPT-5.6-Sol 不只是聊天,能直接干复杂编程活了,比如自己重构 Next.js 服务器。想看看模型实际生产力有多强?这篇实测值得看。
稀宇科技要推 2.7 万亿参数的大模型,比之前开源的 M3(428B)大了一个数量级,想了解国产模型天花板可以关注。
GPT-5.6 来了,参数 2-4T,带 Ultracode 推理层级,还有 Cerebras 版速度飙到 750 tokens/s。想试试新模型的可以关注了。
Ollama 把 GLM-5.2 的云推理速度拉到 80-120 tok/s,比别家快两倍多,还支持 VS Code 和 Claude Code 调用。
这篇论文教你怎么用 ASV 框架来拆解 AI agent 每一步的决策价值,在开放问答任务上实测发现短 rationale 反而有害,做 agent 评估的必看。
看看Danus怎么用事实图记忆帮多个推理智能体协作解数学难题,还能和数学家互动。