Google 出了两个新模型 Gemini 3.6 Flash 和 3.5 Flash-Lite,专为智能体场景优化,延迟更低、token 更省,做自动流程的可以看看。
#推理模型
Google 更新了三个新模型:3.6 Flash 更省 token,3.5 Flash-Lite 主打便宜,还有个专门搞网络安全的 Cyber 版本,选模型下拉菜单就能用。
Google 发布了三款新模型,其中 Gemini 3.6 Flash 在省钱和代码能力上明显提升,编程场景能省 65% Token,Computer Use 成功率 83% 值得一试。
杨植麟从Transformer-XL、XLNet到Kimi K3,只用16个专家就做到1M上下文,值得看看他的思路。
NVIDIA 把 40 亿参数的开放世界模型塞进设备端,机器人不用联网就能自己理解环境、推理并执行动作,适合边缘部署场景。
小模型也能提升推理?MADA-RL用LoRA微调1/16参数,让1.5B模型准确率涨2个点,评论家专挑生成器错误来纠正。
Anthropic的数学家随手用Fable 5怼翻了87年的雅可比猜想,OpenAI的Codex也跟上了,连张益唐当年都没搞定,AI这波真有点猛。
这篇论文教你如何让大模型不再自己绕圈圈,用激活引导精准干预推理过程,实测有效提升准确率。
阿里发了Qwen-3.8 Max预览版,参数量2.4T,速度比Kimi-K3快一个数量级,限时一折,正式版很快开源,感兴趣可以试试。
Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
有人把 Claude Fable 5 的思维链塞进了 MiniCPM5-1B,搞出个 657MB 的本地推理模型,128K 上下文还能看它怎么想的,部署门槛极低。
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
这篇论文用象棋做实验,清晰展示了预训练对强化学习效果的预测关系,1B模型验证了规律,读起来很扎实。
想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。
阿里新出的2万亿参数大模型Qwen3.8-Max-Preview,号称只比Fable 5差一点,已经能直接试用了,想看看它有多强可以测测。
SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。
Kimi K3定价$3-15/M token,比美国模型便宜很多,看看Moonshot怎么用低价倒逼市场。