7月22日
17:25
17:25官方一手marktechpost@Asif Razzaq
Unsloth通过重写底层内核加速训练。Axolotl组合多种并行策略优化多GPU效率。TRL提供了被其他框架依赖的标准训练器API。LLaMA-Factory以支持最广泛的模型覆盖为目标。这四个框架均基于PyTorch和HuggingFace生态。
推荐理由:想微调LLM选框架?这篇对比了Unsloth、Axolotl、TRL和LLaMA-Factory,讲清了各自的速度、显存和多GPU表现,帮你快速决策。
17:15
17:06
17:06Thomas Wolf@Thom_Wolf
Poolside AI 发布最新 agentic coding 模型 Laguna S 2.1。在 Terminal-Bench 2.1 上得分 70.2,与 5-25 倍大小的模型并列甚至领先。在 DeepSWE 基准上得分 40.4,超越部分超 1T 参数的开源模型。该模型可在单个 DGX Spark 或 Mac 上本地运行。
事件专题

推荐理由:Poolside 又出了个厉害编码模型,Laguna S 2.1 在本地就能跑,多项基准比大它几十倍的模型还强。
16:45
16:45量子位@量子位的朋友们
78°
百度文心助手任务Agent在国际权威智能体评测榜单上综合得分第一,超越Claude和GPT。该Agent在任务分解上表现优于Claude,在代码执行上优于GPT。百度文心助手任务Agent此次登顶国际权威榜单证明其智能体能力。
推荐理由:百度文心搞的Agent居然干翻了Claude和GPT,拿了个全球第一,挺牛的,值得看看。
15:32
15:32@koltregaskes@koltregaskes
一位用户在X平台表示,经过一段时间使用后,认为GPT-5.6是自GPT-4相比GPT-3.5以来最明显的性能跳跃。该模型更善于按照指令完成任务,执行力显著增强。用户同时指出主要问题在于Codex(编程界面)仍需大量改进。
事件专题

推荐理由:有用户说GPT-5.6干活更利索比之前版本强一大截,但Codex还不够好,来看看他的体验。
14:04
14:04官方一手歸藏(guizang.ai)@op7418
78°
谷歌上线Gemini 3.6 Flash模型,相比3.5 Flash在编码、推理和工具调用上有所提升,在DeepSWE基准上输出token减少高达65%。同时推出速度更快的3.5 Flash-Light模型。谷歌宣布已开始训练Gemini 4,称规模为史上最大,目标对标GPT-5.6和Fable 5。目前模型迭代速度落后于一月一版的竞品。
事件专题

推荐理由:谷歌出了Gemini 3.6 Flash,日常模型更强了,编码和推理升级,还省了最多65%的token。另外还有个更快的3.5 Flash-Light,Gemini 4也在训练了,可以关注。
12:30
12:30官方账号arXiv cs.AI@Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman
新基准BioSecBench-Surveillance包含100个评估任务,覆盖7个类别,从分类到基因工程检测。16个模型-工具组合在3962次尝试中,最佳配置Opus 4.8 with PI仅达50.2%准确率,与GPT-5.5 with Codex并列。Opus 4.7 with PI为49.6%,Sonnet 4.6 with PI为48.6%。即使调用正确工作流,错误仍源于参考序列、阈值、过滤器等选择失误。该基准为衡量下次疫情爆发时AI代理的可信度提供了标准。
事件专题

推荐理由:想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。
12:27
12:27官方账号arXiv cs.AI@Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin
PathAgentBench评估视觉语言模型在整张病理切片上的四种能力:跨模态匹配、区域定位、多尺度推理。基准包含1822张TCGA整张切片和17135条诊断路径。在20个模型中,开源模型在多尺度推理上达到93%准确率,但诊断区域定位的IoU低于0.09。自主探索时高倍放大下命中率仅0.020,表明从WSI获取证据仍具挑战。
推荐理由:想测试病理AI能不能像医生一样在超大图片里找病灶?这个基准专门考这个,结果发现定位能力还很弱。
12:09
12:09官方账号arXiv cs.LG@Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang
ISO是一种专门为可验证奖励强化学习(RLVR)设计的优化框架。它通过保持基模型的权重谱不变,仅优化输入输出奇异帧来实现模型适配。离线版本ISO-Merger无需数据或梯度就能合并多个专家模型,在无数据合并方法中性能最强。在线版本ISO-Optimizer在Qwen3-8B-Base上,仅用100步就达到AdamW需270步的准确率(0.495),210步后进一步提升至0.509。实验覆盖1.5B到8B参数的推理与代码任务。
推荐理由:如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。
11:28
11:28小互@imxiaohu
72°
通义发布了图像生成模型Qwen-Image-3.0,支持单条指令生成九张信息图或一整版报纸。该模型原生渲染12国语言,覆盖100+艺术风格,并可仿真网页游戏直播界面。它还能联网获取最新世界知识,指令上限提升至4.5k token,一次交代完整复杂内容。
推荐理由:通义新模型Qwen-Image-3.0来了,能一次性画九张信息图甚至整版报纸,支持12国语言和100多种艺术风格,指令上限4.5k token,复杂需求一次搞定。
10:27
10:27官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
MindLab发布Macaron-V1,一种基于混合LoRA的后训练方法,应用于GLM 5.2。该方法包含4个专门的1B参数专家适配器,支持2M token上下文扩展。通过RL训练,748B参数的Venti变体仅用64块GPU即可完成训练,显著降低万亿参数模型的后训练成本。

推荐理由:MindLab用Macaron-V1在64块GPU上训出748B模型,比传统RL省资源,适合想低成本强化大模型的人
10:25
10:25官方一手pandaily@contact@pandaily.com (Pandaily)
昆仑万维发布Mureka V9.5,采用O3反思推理技术提升音乐自然度。搭配MuCo创作智能体实现专业化制作。生成的AI音乐在音质和情感表达上接近人类创作,减少机器痕迹。该版本在音色连贯性和旋律流畅性上优于前代V9。

推荐理由:昆仑万维的Mureka V9.5用O3推理让AI音乐听起来不像机器做的,做歌更自然,值得试试。
10:12
08:52
08:52Fireworks AI@FireworksAI_HQ
精选
MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。
推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
08:09
08:09官方一手marktechpost@Asif Razzaq
精选
Poolside发布Laguna S 2.1,这是一个118B参数的MoE编码模型,每token仅激活8B参数,支持1M上下文。该模型在SWE-Bench Multilingual基准上匹配甚至超越参数规模数倍于它的模型。Laguna S 2.1采用OpenMDW-1.1开放权重许可,可在单台NVIDIA DGX Spark上运行。
事件专题

推荐理由:Poolside出了个小参数但很强的编码模型Laguna S 2.1,8B活跃参数就在SWE-Bench多语言上吊打大模型,还开放权重,单机就能跑。
06:52
06:52OpenRouter@OpenRouterAI
76°
OpenRouter于今天上线了Gemini 3.6 Flash和Gemini 3.5 Flash-Lite两个新模型。两者均支持超过150 tokens/秒的高吞吐量,面向智能体场景优化。模型擅长token高效的编码和知识工作,也可用于低延迟高并发的子智能体。这是Gemini系列的最新升级,进一步提升了性能和响应速度。
事件专题

推荐理由:OpenRouter上了两个新模型:Gemini 3.6 Flash和3.5 Flash-Lite,吞吐超150 tok/s,适合做智能体和子智能体,跑代码和知识工作很快。
06:50
06:43
06:43lmarena.ai@lmarena_ai
Chatbot Arena 推出了 Agent Arena 和 Frontend Code Arena 两个新排行榜。Agent Arena 评估 AI 智能体在真实世界任务中的表现,Frontend Code Arena 专门评测模型的前端代码生成能力。排行榜数据来自用户对战投票,结果实时更新在 arena.ai 上。
推荐理由:想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。