Opus 5 性能强于 4.8,价格不变,还接近 Fable 5 但便宜一半,值得升级。
NVIDIA团队用智能体协作拿下两个Kaggle大赛名次,还缩小了大小模型性能差距,挺有启发的。
NVIDIA AI 刚发了 NeuroGolf 冠军方案和 KDD Cup 榜单,做竞赛的朋友可以看看。
Claude Opus 5价格只有Fable 5的一半,token效率更高,适合想要前沿智能又不想花大钱的用户。
Anthropic发了Opus 5,比Fable更便宜,限制也更少,日常用更香。
vLLM 出了个新插件,把 MoE 推理的注意力层和专家层拆分部署,想分别扩缩容就方便了,支持 NVIDIA 和昇腾卡。
OpenAI 的模型命名越来越绕了,看看 E 教授的实测对比,帮你搞清 GPT-5.6 各版本谁最强。
微软开源了27B的电脑操作Agent Fara1.5-27B,能控制电脑做网页自动化,本地就能跑,RPA可以退了。
Handoff 的 H1 模型专啃建筑蓝图,自动算材料清单,准确率 81.6%,比八个通用 AI 模型还强。搞施工估算的可以看看。
这个国产模型在权威榜单上拿了第一,还完全开源,用昇腾就能跑,值得看看。
有人给Codex一个递归的提示,让它造一个基准的基准,结果它真给你生成了完整的论文PDF,挺有意思的玩法。
Google出了个能在CPU上跑的3D头部模型gmn,所有表情都能调,还有在线demo直接玩,做虚拟人搞渲染都方便了。
Sakana的新版Fugu Ultra v1.1性能提升7.9分,还多了Claude Code接口。没把Fable 5放池里就说能赢,挺有意思的。
谷歌刚把Gemini 3.6 Flash和3.5 Flash-Lite的采样参数废了,用这两个模型的开发者快去更新代码吧。
Hyper3D Rodin直接从零件模型生成可交互动画,省掉手动绑定骨骼的功夫,做游戏和动画效率能高不少。
蚂蚁新出的Ling-3.0-flash用124B参数(仅激活5.1B)就打平了1T的旗舰模型,还能支撑复杂Agent任务,现在免费试用,8月3日后开源,别错过。
Kimi K3在网络安全测试中只拿了32分,远低于美国模型的76%,而且安全机制基本失效,传闻是因为用了蒸馏技术。
ListenHub和Labnana刚上了Seedream 5.0 Pro,画动漫比GPT Image 2还好,还能局部修图,快去试试!
FLUX 3 能一次生成20秒带声音的视频,还打败了Grok和Gemini同类模型,值得玩玩。
阿里新开源的0.8B模型OvisOCR2,端到端做文档解析,96.58分刷榜OmniDocBench,比传统流水线方法强。小模型就能做到,部署还简单,搞RAG、知识库的可以试试。
月之暗面新发的 Kimi K3 在知识工作跑分上干掉了 GPT-5.6 Sol,只输给 Claude Fable 5,看参数和表现都很猛。
35家央国企实测验证,因果世界模型在因果推断上能帮企业做更准的决策,适合业务落地。
一个AI代理自己研究LLM微调,还能拿博士水平,看看它怎么做到的。
Emollick 实测对比了 GPT-5.6 系列和 Fable 5,告诉你哪个版本才是真正的推理之王,别再被名字骗了。
BFL 新出的 FLUX 3 图像生成超强,直接吊打 Seedance 2.0、Gemini Omni 和 Grok Imagine,还带了个机器人模型,快来看看。
想精确控制视频里多个物体的互动?GraphVid用交互图代替画轨迹,效果比Motion-I2V好很多,FID降了40%。
FLUX 3 把图像、视频、音频放一起训,还能预测动作。已经能生成20秒带声音的视频,图像也快上了。
想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
想要生成可变长输出的流模型?这篇提出了EFlows和EFMs,把扩张和去噪打包成一个可学操作,还能处理图和序列,挺新鲜。
做分子性质预测的朋友看过来:新模型EnsembleEGNN把多个构象编码成一个嵌入,在环肽任务上比纯序列模型效果好,R²提升到0.538。
想提升音频模型的逻辑推理?这个框架用文本教师蒸馏,在MMSU等基准上效果拔群,比纯音频训练强很多。
TTEL能定位推理错误,只重算出错部分,省近一半计算量。Qwen3-8B在编程测试上成绩亮眼,值得关注。
Together Compute 下了个对比,Kimi 和 GPT 在修 bug 上各有绝活,组合用比单干划算得多。
阿里云新出的Qwen-Audio-3.0-TTS模型在OpenRouter上就能用,语音听起来更自然,做语音交互的可以试试。
GS-Agent把多个AI智能体和物理引擎连起来,你只要说句话就能生成带物理模拟的4D场景,液体、物体碰撞都能搞定,做内容创作或模拟都省力。
PATS用动态训练支架帮弱策略少犯错,ALFWorld和WebShop上最高提升18.6%,而且部署时没负担。
想测LLM的长对话记忆力?RUMBA这个俄语基准能细粒度诊断模型在时间推理上的强项和短板。
黑森林家的FLUX 3 刚曝光,既能文生视频又能带音效,还和Seedance 2.0打了个平手,甚至能控制机械臂。想尝鲜的可以去申请测试。
微软自己训练的新图像和语音模型,不用别人蒸馏,已经在Bing和PPT里用了,GPU成本降了八成多,价格也公开了。
Black Forest Labs的FLUX 3把图像、视频、音频和机器人动作预测塞进一个模型,已经跟真实机器人合作跑起来了。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。