#推理模型
OpenAI 下周可能发 GPT-5.6,配额更宽松,专门抢 Claude 用户。同时 Gemini 3.5 Pro 也跳票到 7 月 17 日。想了解前沿模型动态的可以关注。
AI/ML API 实测了 Sonnet 5 和 Fable 5 做3D地球生成,Sonnet省87%钱但只有线框,Fable效果惊艳但贵。选模型前先看这对比。
PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。
ReContext不用训练就能让模型用上长文里的关键信息,Qwen3和Llama3上都有效,适合处理超长文档推理。
一篇论文用推理模型做说话人识别,还建了个53万条对话的新基准,短话识别效果比现有方法强不少。
这篇论文提出了DemoPSD,通过分歧调节蒸馏过程,比GRPO和SDPO在科学推理上更强,还能防止模型学到测试时无效的捷径。
这篇论文解决了OPSD在长推理模型上越蒸馏越笨的问题,用PMI过滤器保留思考能力,值得做推理优化的朋友看看。
想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。
Anthropic发现Claude Code的新模型Fable 5太聪明,系统提示反而碍事,直接砍掉80%。
Anthropic 的 Claude Sonnet 5 写前端代码得分比上代高 29,还超过 Opus 4.6。搞前端的可以试试它的自主编程能力。
poolside新出的Laguna XS 2.1,33B MoE专为编程智能体设计,SWE-bench 70.9%还支持Mac本地跑,值得编程党试试
这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。
OpenAI和Anthropic现在每1-2个月发一次新版,谷歌要75天还断过154天,速度差距越来越大了。看看他们怎么用发布节奏建护城河。
想加速推理重排序又不想掉精度?这篇把自回归GR2换成块扩散,速度提升2.4倍以上,准确率几乎没降,干货满满。
Cursor 里又能用 Claude Fable 5 了,它在 CursorBench 上排第一,就是有点贵,适合追求极致效果的场景。
AWS 把 NVIDIA 的 Nemotron 和 OpenAI 的 GPT OSS 模型搬上 GovCloud 了,有 6 种不同规模的开放权重模型可选,适合需要数据驻留的合规场景。
LiteResearcher是专门为深度研究智能体打造的RL训练框架,能更高效地训练复杂推理能力,适合关注智能体研究和强化学习的朋友。
SGLang 和 NVIDIA 联手让 DeepSeek V4 在 Blackwell 上跑得快了 5 倍,开源推理引擎的效率又上了一个台阶。
中国初创搞的世界模型火了,能反复推演不同情境,Hugging Face上热度第一,周鸿祎和陆奇都投了,做推理模型的朋友可以看看。
Sonnet 5 换了tokenizer后费用涨了,金融评测很强但编程费钱,Opus 4.8和GPT 5.5各有特长,选模型前先算账。
OpenAI 搞了个新基准 GeneBench-Pro,专门测模型做复杂生物分析时的判断力,GPT-5.6 Sol 表现很亮眼,比之前强不少。
Anthropic 昨天刚被爆出在系统提示里藏东西,今天就急着把 Fable 5 恢复上线,还附赠了 Sonnet 5 的成本 bug,挺热闹的。
这篇论文提出了GR2,在工业重排序上拿下了18.7%的召回提升,还解决了LLM作弊奖励的问题,做推荐系统的可以看看。