12:05官方一手arXiv: DeepSeek@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang精选73°PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化独立矩阵误差转变为保留专家输出误差。在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型的精度差距分别缩小1.41倍和1.44倍,同时实现相同的峰值内存减少。论文MoEPARSERQwen推荐理由:PARSER方法通过输出重要性指标优化MoE模型压缩,在相同内存减少下提升模型精度。原文稍后读已读值得跟进有用关注 MoE
09:59官方账号arXiv cs.AI@Kirill Labzin, Stepan Kulibaba, Artem Dzhalilov, Artem Gorokhov精选73°研究人员发现稀疏专家模型各层路由状态共享共同几何结构,通过广义正交Procrustes分析对齐后,单个线性转换可达到0.39-0.71的R²值,保留79-90%的预测能力。残差表示跨层更易预测,而路由控制状态更忠实保留模型专家选择。使用预测的规范状态替代原生路由状态,在OLMoE上降低ΔNLL 15.7%,在Phi上10个路由器范围内降低6.2%。论文稀疏专家模型MoE路由推荐理由:斯坦福团队揭示稀疏专家模型路由层间共享几何结构,能预测跨层路由行为,提升模型效率。原文稍后读已读值得跟进有用关注 稀疏专家模型
09:32官方一手arXiv: DeepSeek@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang精选73°PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化孤立矩阵误差转变为保留专家输出误差。实验显示,在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型之间的精度差距分别缩小1.41倍和1.44倍,同时实现了相同的峰值内存减少。论文MoEPARSERQwen推荐理由:PARSER方法解决了MoE模型压缩中误差累积问题,在相同内存减少下提升模型精度。原文稍后读已读值得跟进有用关注 MoE
10:12官方账号arXiv cs.AI@Deokjae Lee, Sihun Chu, Hyun Oh Song精选73°Q-Strata是一种双层分配器,针对Mixture-of-Experts模型提出。该方法在每个MoE块内使用廉价代理进行候选排名,并在块间设置预算。在Mixtral-8x7B-Instruct、Qwen1.5-MoE-A2.7B和DeepSeek-V2-Lite模型上测试,Q-Strata在低比特率下实现了比均匀比特宽度的GPTQ和最先进的MoE MPQ方法MxMoE、GEMQ更低的WikiText2困惑度。论文Q-StrataMoE混合精度量化推荐理由:SNU MLLab团队发布Q-Strata,解决了MoE模型混合精度量化的难题,比现有方法性能更好。原文稍后读已读值得跟进有用关注 Q-Strata
11:45官方账号arXiv cs.AI@Simeng Sun, Roger Waleffe73°研究人员提出通信高效专家混合模型(CE-MoE),采用异构层模式解耦令牌混合和通道混合深度。在2B至31.5B参数规模测试中,CE-MoE模型在匹配总参数和激活参数的情况下,减少了33.3%的GPU训练时间,同时保持验证损失和下游基准性能与全MoE基线相当。31.5B规模时,CE-MoE还提升了平均下游分数和推理吞吐量。论文MoECE-MoE专家混合推荐理由:新方法让31.5B参数模型训练省1/3时间,性能还更好,适合大规模MoE模型训练。原文稍后读已读值得跟进有用关注 MoE
01:47Hunyuan@TXhunyuan78°腾讯混元开源Hy4预览版,这是一款旗舰级MoE模型,拥有1M上下文长度。该模型总参数量770B,每激活49B参数。在163位内部专家对203个真实工程任务的盲评中,Hy4平均得分2.99,略高于GLM 5.3(2.92)和Kimi K3(2.94)。模型基于真实生产工作流训练,涵盖软件工程、办公、数据分析和科研等领域。AI模型Hy4混元ModelScope推荐理由:腾讯混元开源了Hy4预览版,1M上下文+770B参数,在真实任务评测中超越GLM和Kimi原文稍后读已读值得跟进有用关注 Hy4
01:46Hunyuan@TXhunyuan精选73°腾讯混元Hy4预览版可在vLLM环境中运行,已在NVIDIA GPU上验证。该模型总参数770B,激活参数49B,包含256个路由专家和一个共享专家。上下文长度为1M,但每个查询仅关注2048个token。模型中仅21层计算稀疏索引,其余57层复用同一索引。AI模型Hy4vLLM腾讯混元1 个信源在谈事件专题推荐理由:腾讯混元Hy4预览版已适配vLLM,支持MoE和HPC-Ops内核,可直接部署使用。原文稍后读已读值得跟进有用关注 Hy4
19:10官方账号arXiv cs.LG@Hai-tao Yu, Nan Min, Zheng Fang, Hongyu Zhan, Yusen Tan, Yuhan Wang, Jun Xia精选73°MM-Spectrum 是一种稀疏 MoE 框架,专为多模态多光谱光谱到结构解析设计。该框架引入了显式模态感知路由机制,结合共享和交互专家,以及异构专家容量。在完整模态、双模态和缺失模态设置下,MM-Spectrum 在分子结构解析任务中取得了一致的显著改进。论文MM-SpectrumMoE多模态推荐理由:研究人员提出 MM-Spectrum 框架,解决了多光谱信号异质性问题,在分子结构解析任务中表现优异。原文稍后读已读值得跟进有用关注 MM-Spectrum
19:02官方一手arXiv: DeepSeek@Rongfeng Wang, Shichao Weng, Zhiqiang Wang, Xinyu Liu, Yang Yi, Peilong Zhou, Hongwei Tang精选73°MetaNet提出了一种支持集控制器,可为每层预测专家保留阈值和有界路由偏差。在DeepSeek-MoE-16B-Chat模型上,保守设置激活专家数减少40%,MMLU准确率0.489;激进设置激活专家减少62%,准确率下降3.7个百分点。MMLU训练的控制器无需重训即可迁移到C-Eval,激活专家减少52%,准确率达0.386。论文MetaNetMoEDeepSeek-MoE-16B-Chat1 个信源在谈事件专题推荐理由:MetaNet让MoE模型根据任务难度动态分配专家,大幅减少计算量同时保持准确率。原文稍后读已读值得跟进有用关注 MetaNet
05:43官方一手marktechpost@Asif RazzaqZ.ai推出GLM-5.3-Flash,GLM-5系列首个原生多模态模型,320B总参数/18B激活MoE,1,048,576令牌上下文窗口,MIT授权Hugging Face权重,API定价0.15美元/输入和0.50美元/输出。在Terminal-Bench 2.1上得分84.3,在DeepSWE v1.1上得分63.4,使用混合KDA线性加NoPE稀疏MLA注意力减少注意力计算约3倍,KV缓存4.4倍于GLM-5.3。AI模型GLM-5.3-Flash多模态MoE上下文窗口10 个信源在谈事件专题推荐理由:Z.ai发布GLM-5.3-Flash,原生多模态MoE,上下文窗口更大,性价比高,值得尝试。原文稍后读已读值得跟进有用关注 GLM-5.3-Flash
10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。论文Mixture-of-ExpertsMoE超参数推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。原文稍后读已读值得跟进有用关注 Mixture-of-Experts
15:28官方账号arXiv cs.AI@Cedric Caruzzo, Donggeun Yoo, Tae Soo Kim该论文研究同权重MoE自蒸馏中,教师和学生模型共享权重但路由不同专家的问题。通过精确的块级分解,将路由项与内容项分离,在7个开源检查点和2个领域上测试。结果显示路由项对块输出的影响仅1.6倍,残差流暴露为3.2倍。PubMedQA预注册实验表明,路由项移动输出的效果不到自然上下文效应的一半,且可被匹配范数噪声复现。结论是路由移动本身不能证明行为影响,需先测量暴露度。论文MoE自蒸馏路由推荐理由:这篇论文把MoE路由分歧讲透了,用分解和实验证明路由项影响很小,做自蒸馏的值得看看。原文稍后读已读值得跟进有用关注 MoE
10:24官方一手arXiv: DeepSeek@Lie Li, Wen Li, Junxiao Shen, Gusheng Hu精选MAPLE是一个即插即用的MoE专家分配框架,可在不修改权重不重训练的前提下,按层重新分配路由专家预算。其核心是封闭式灵敏度引导分配,并用灵敏度约束的遗传搜索进一步优化。在DeepSeek-MoE-16B上,MAPLE仅用75%专家即在ARC-E上从65.09提升至71.40,ARC-C从48.49提升至51.50,BoolQ从80.03提升至82.38。通过SGLang部署,单GPU端到端延迟降低32.2%,吞吐量提升47.4%。AI模型MAPLEDeepSeek-MoE-16BSGLang推荐理由:MAPLE这个插件能让MoE大模型少开专家还更准,DeepSeek-MoE-16B用75%专家就能超原版,还快32%,不用改权重就能用。原文稍后读已读值得跟进有用关注 MAPLE
10:15官方账号arXiv cs.LG@Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng LiDeaMoE是一种解码高效混合专家架构,将专家按专业领域分组为部门,同部门专家共享大部分参数,并各自保留少量私有参数。它采用定制两阶段路由策略,避免冗余加载,大幅提升大模型解码效率。相比vanilla MoE,DeaMoE每步加载权重最多减少50.9%,7B模型在A40上端到端TPOT加速1.33倍。在微基准测试中,DeepSeek-V3在A40和H100上分别达到2.00倍和1.97倍的峰值加速。AI模型DeaMoEMoEDeepSeek-V31 个信源在谈事件专题推荐理由:DeaMoE让MoE小批量解码少搬权重、跑得更快,7B模型在A40上TPOT提速33%,DeepSeek-V3加速近2倍。原文稍后读已读值得跟进有用关注 DeaMoE
02:01官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。AI模型QwenDeepInfraMoE推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。原文稍后读已读值得跟进有用关注 Qwen
00:28官方账号阿里通义 Qwen@Alibaba_Qwen78°阿里Qwen团队发布Qwen3.8-Max,总参数2.4T、激活参数95B、上下文窗口1M。该模型为开源权重MoE,编码与智能体能力突出。Together AI作为Day 0发布伙伴,已同步上线推理服务。开发者现可直接在Together AI平台调用该模型。AI模型Qwen3.8-MaxTogether AI开源模型推荐理由:Qwen3.8-Max刚发布就上了Together AI,2.4T参数的开源MoE,当天就能用,编码和智能体能力都挺强。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
00:27官方账号阿里通义 Qwen@Alibaba_Qwen阿里通义千问的Qwen3.8-Max(即Qwen3.8-2.4T-A95B)在Fireworks平台首发上线,获得Day 0支持。这款模型采用MoE架构,总参数达2.4T,激活参数95B,专为自主智能体、重度编码和超长上下文场景设计。开发者现可通过Fireworks直接调用,用于构建agent工作流和代码生成任务。AI模型Qwen3.8-MaxFireworks智能体推荐理由:阿里把2.4T参数的MoE模型Qwen3.8-Max放到了Fireworks上,今天就能用,专门干智能体和写代码的活儿。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
12:29官方一手arXiv: DeepSeek@Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song论文在专家并行MoE服务中发现,GPU吞吐量并不由token数或激活专家数单独决定:约156-168 token以下是显存权重流主导,以上则按128-tile对M维度取整。据此提出TEMPO调度器,将每批调度建模为固定费用makespan问题,在毫秒级求解;在8卡Testbed A上,相对最优固定基线最多提升15.5%,其余场景差距在1%以内。端到端测试中,Qwen3-235B吞吐提升4-6%、p99延迟降低约15.6%,DeepSeek-V3则未见收益。TEMPO论文强调这是阶段图预测的结果,并非普适胜利。论文TEMPOMoE专家并行推荐理由:如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。原文稍后读已读值得跟进有用关注 TEMPO
20:52shao__meng@shao__meng微信团队在 X 上发布 WeLM 大语言模型系列,包含 80B (A3B) 和 617B (A23B) 两个型号。其中 A3B 指激活 3B 参数,A23B 指激活 23B 参数,对应总参数规模为 80B 与 617B。WeLM 由 Weixin 团队打造,官方帖文强调其核心优势是资源效率,并以 X 作为首发渠道。AI模型WeLM微信MoE推荐理由:微信出了 WeLM,80B 和 617B 两个版本,主打省资源,激活参数只有 3B 和 23B。想省算力可以看看。原文稍后读已读值得跟进有用关注 WeLM
18:15官方账号NVIDIA AI@NVIDIAAI精选英伟达发布Nemotron 3.5 Lightning,一款30B参数的MoE模型,活跃参数仅3B。该模型由Nemotron 3 Ultra蒸馏而来,现已上线Fireworks平台。它在PinchBench上表现强劲,并在AA-Omniscience非幻觉测试中获得顶尖分数。模型专为高吞吐智能体工作流设计,强调可靠性与专精化。AI模型NemotronFireworksNVIDIA10 个信源在谈事件专题推荐理由:想做智能体又怕模型太贵太慢?Nemotron 3.5 Lightning只有3B活跃参数,在Fireworks上直接就能调。原文稍后读已读值得跟进有用关注 Nemotron
18:10Fireworks AI@FireworksAI_HQ精选Qwen3.8-2.4T-A95B 已在 Fireworks 平台上线,提供 Day-0 支持。该模型采用 2.4T 参数 MoE 架构,专为自主智能体、重度编码和大上下文窗口设计。Fireworks 表示它适合编码和智能体任务,开发者现在即可开始使用。AI模型Qwen3.8-2.4T-A95BFireworks智能体推荐理由:Fireworks 上线了 Qwen3.8-2.4T-A95B,2.4T 参数 MoE,主打智能体和写代码,有 Day-0 支持,直接就能用。原文稍后读已读值得跟进有用关注 Qwen3.8-2.4T-A95B
17:48IT之家(博客/媒体)微信团队发布大语言模型 WeLM,核心方向是资源利用效率。WeLM-80B 拥有 800 亿总参数和 30 亿激活参数,已部署在微信原生 AI 助手小微上,支持聊天、搜索和调用小程序服务。WeLM-617B 总参数达 6170 亿、激活参数 230 亿,采用混合专家(MoE)架构,目前正在开发中,面向智能小程序开发和小微工具生成等复杂任务。AI模型WeLM微信腾讯推荐理由:微信自己搞的 WeLM 80B 已经在小微里落地了,617B MoE 版也在路上,做微信生态开发的可以盯一下。原文稍后读已读值得跟进有用关注 WeLM
07:20官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。AI模型Nemotron 3.5 LightningNVIDIAdistil labs10 个信源在谈事件专题推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:42Aravind Srinivas@AravSrinivas精选NVIDIA 的 Nemotron 3.5 Lightning 现已面向所有开发者开放,可通过 Perplexity Agent API 调用。该模型为开源 30B MoE 架构,仅激活 3B 参数,专为高频智能体执行层设计,适用于工具调用、验证和子智能体任务。输入定价为每百万 tokens 0.0115 美元,输出定价为每百万 tokens 0.17 美元。开发者可将 Lightning 与 Nemotron Ultra 等前沿模型搭配,用于规划与批量执行。AI产品Nemotron 3.5 LightningPerplexityNVIDIA10 个信源在谈事件专题推荐理由:NVIDIA 把 30B MoE 的 Lightning 放到 Perplexity API 上了,每百万输入才 1 分多钱,适合跑高频工具调用,跟 Ultra 搭配干活很划算。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
16:02官方一手marktechpost@Asif Razzaq精选NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
09:52IT之家(博客/媒体)英伟达于8月11日发布Nemotron 3.5 Lightning,这是一款拥有300亿参数的MoE开源模型,专为大型多智能体系统设计。相比同类模型,其输出速度最高提升4倍,智能体任务整体完成速度加快30%。该模型支持本地运行于NVIDIA RTX PC、DGX Spark等设备,也可扩展至企业级数据中心和云端环境。开源链接已提供在Hugging Face、ModelScope和OpenRouter等平台。AI模型Nemotron 3.5 Lightning英伟达开源模型10 个信源在谈事件专题推荐理由:英伟达新出的30B开源模型,跑智能体任务比同类快4倍,还能本地跑,搞多智能体开发的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
03:46Aravind Srinivas@AravSrinivasNVIDIA推出Nemotron 3.5 Lightning,这是一款开放权重的30B MoE模型,仅3B参数激活,专为常驻智能体设计,可高效处理高吞吐、专业化任务。其输出速度比同类模型快4倍,能在笔记本或DGX Spark等本地硬件上流畅运行。用户也可通过Perplexity使用更大的Nemotron Ultra版本。AI模型Nemotron 3.5 LightningNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA新出的开源MoE模型,30B参数但只激活3B,笔记本就能跑,速度还快4倍,做智能体任务很合适。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
00:46ollama@ollama精选NVIDIA 的 Nemotron 3.5 Lightning 现已可通过 Ollama 本地运行。这是一款 30B 参数的混合专家模型,仅激活 3B 参数,支持 1M token 上下文。该模型专为常驻运行的智能体设计,擅长编码、工具调用和多轮对话。相比同类规模的开源模型,其吞吐量提升 4 倍,任务完成时间降低 30%。用户可通过 Claude Code、Hermes Agent 或 OpenClaw 等工具直接调用。AI模型Nemotron 3.5 LightningNVIDIAOllama10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B 模型,跑在本地,专门给常驻智能体用,速度快 4 倍,还支持 1M 上下文,搞智能体的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
23:29Fireworks AI@FireworksAI_HQ精选NVIDIA 推出 Nemotron 3.5 Lightning,这是一款 30B MoE 模型,仅 3B 参数激活,专为高吞吐智能体任务设计。该模型从 Nemotron 3 Ultra 蒸馏而来,在 PinchBench 和 AA-Omniscience Non-Hallucination 基准上表现强劲。目前已在 Fireworks 平台上线,供开发者用于构建智能体工作流。AI模型Nemotron 3.5 LightningNVIDIAFireworks10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B MoE 模型,3B 激活参数跑得快,专为智能体场景优化,Fireworks 上直接能用。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
22:43OpenRouter@OpenRouterAI精选NVIDIA Nemotron 3.5 Lightning已在OpenRouter上线。该模型为30B混合专家架构,仅激活3B参数,由Nemotron 3 Ultra蒸馏而来。它面向高容量、专业化的AI智能体工作负载,相比同类模型吞吐量最高提升4倍,任务完成速度最高快30%。AI模型NemotronNVIDIAOpenRouter10 个信源在谈事件专题推荐理由:NVIDIA新出的轻量MoE,30B参数只激活3B,跑智能体任务比同类快30%,想省算力可以试试。原文稍后读已读值得跟进有用关注 Nemotron
22:03官方账号NVIDIA AI@NVIDIAAI精选73°NVIDIA推出Nemotron 3.5 Lightning,一个30B参数的MoE模型,仅激活3B参数。该模型专为常驻智能体设计,可快速完成高并发、专业化任务。其输出速度比同类模型快4倍。模型已开源,适合需要高效推理的场景。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA出了个30B MoE模型,只激活3B参数,跑得快4倍,适合做常驻智能体,开源可白嫖。原文稍后读已读值得跟进有用关注 Nemotron
18:01IT之家(博客/媒体)精选蚂蚁百灵在 Hugging Face 开源 Ling-3.0-tiny 模型,总参数 7.9B,每 Token 激活 1.3B 参数,采用混合推理 MoE 架构。该模型将 KDA 和 MLA 按 3:1 比例交替堆叠,包含 128 个路由专家,兼顾上下文处理与计算成本。官方提供 BF16、FP8 和 INT4 权重版本,适配不同平台。在 M4 Pro MacBook 上推理速度约 86-90 Token/s,8K 上下文峰值内存约 8.34 GiB。AI模型Ling-3.0-tiny蚂蚁百灵MoE推荐理由:蚂蚁百灵开源了个轻量推理模型,7.9B 参数但每 Token 只激活 1.3B,Mac mini 上跑得飞快,适合本地部署。原文稍后读已读值得跟进有用关注 Ling-3.0-tiny
11:07官方账号arXiv cs.LG@Nagur Shareef Shaik, Jeongwoo Park, Yeong-Jin Kim, Jaeuk Jung, Hyunjung Oh, Dong Hye Ye视网膜眼底图像常同时存在多种病理,但标准深度学习分类器对所有图像施加静态相同计算。研究者提出新架构,结合引导上下文门控空间注意力和稀疏路由专家混合模块,实现可解释的数据驱动分解。专家分配显著依赖疾病,健康状态和形态学上不同的病理隔离到专属专家。在五类患者分离的5折交叉验证中,模型达到0.912±0.008宏AUC和0.653±0.014宏F1。Grad-CAM++和t-SNE可视化证实专家路由与局部病灶对齐,并将共病案例映射到其组成簇之间。论文视网膜MoE稀疏路由推荐理由:这篇论文用稀疏MoE做视网膜多病分类,专家分配能对应具体病灶,宏AUC到0.912,搞医学影像的可以看看。原文稍后读已读值得跟进有用关注 视网膜
10:49官方一手arXiv: DeepSeek@Matteo Grella精选PTQTP将LLM权重矩阵分解为两个三元平面,本研究首次将尺度比固定为3的约束引入其求解器,使分解坍缩为统一九级量化器。两个三元平面无损折叠为4位码平面,作为持久服务表示,磁盘字节、专家缓存和内核输入均为4.0625位/权重块。该方法应用于DeepSeek-V4-Flash-0731的284B-A13B MoE模型,在64GB笔记本上从MXFP4权重一次性量化并流式加载专家。与4.5位Q4_K基线相比,在5/5测试中匹配官方API(Q4_K为4/5),MMLU子集得分86对84,解码速度快6.7%,文件小9%。尽管权重重建误差和困惑度更高,但参考保真度无显著差异。论文PTQTPDeepSeek-V4MoE推荐理由:这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。原文稍后读已读值得跟进有用关注 PTQTP
10:47官方一手arXiv: DeepSeek@Zongfei Li精选一项新研究质疑稀疏MoE路由器中专家选择与输出加权是否应使用相同分数。在预训练的OLMoE-1B-7B上,仅改变集合内聚合方式,结构化oracle将全周期交叉熵提升0.0160±0.0039。研究者训练了301K参数的FDAA后处理头,在冻结主干、路由器和专家的情况下,将WikiText-103测试集Delta CE提升至-0.1523±0.0031。在DeepSeek-V2-Lite上复现固定调度审计,路由器Top1识别最佳选中专家的比例仅为12.5%和16.7%。结果表明专家选择与专家承诺应跨架构区分。论文MoEOLMoEDeepSeek-V2-Lite推荐理由:这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。原文稍后读已读值得跟进有用关注 MoE
10:43官方一手arXiv: DeepSeek@Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao精选FlashBoot是SGLang上的权重加载子系统,针对MoE模型弹性部署中的延迟问题。它通过FabricArena连续内存布局和FlashLoad零拷贝批量传输,将单节点权重加载从20.1秒降至0.4秒,加速50倍。FlashClone利用远程映射替代NCCL初始化,将跨节点复制时间从10-110秒降至约10毫秒。在NVL72上测试DeepSeek-V4-Pro和DeepSeek-V4-Flash,并发机架级加载从87秒降至0.32秒,加速超270倍。论文FlashBootSGLangDeepSeek-V48 个信源在谈事件专题推荐理由:SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。原文稍后读已读值得跟进有用关注 FlashBoot
07:55IT之家(博客/媒体)蚂蚁集团百灵大模型宣布正式开源 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等版本。该模型支持 API 调用、单机私有化和高性能部署三种落地方式,在指定 GPU 测试配置下平均输出速率突破 1100 tokens/s。在 Artificial Analysis 榜单中,Ling-3.0-flash 输出速度为 353 tokens/s,AA Intelligence Index 中每项任务加权平均调用成本约 0.04 美元。8 月 7 日至 8 月 31 日,Ling Studio 上可享 2.5 折优惠。AI模型Ling-3.0-flash蚂蚁集团百灵推荐理由:蚂蚁百灵开源了 Ling-3.0-flash,124B 总参只激活 5.1B,能单机跑,输出超 1100 tokens/s。原文稍后读已读值得跟进有用关注 Ling-3.0-flash
10:11官方账号arXiv cs.LG@Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis该论文通过合成和真实数据上的受控实验,揭示了多模态预训练中语言、视觉理解与视觉生成之间的非对称知识流。研究发现数据复杂度决定模态协同,共享注意力与归一化能促进协同,而早期联合训练优于晚期对齐。实验还发现“视觉懒惰”现象,即延迟融合会导致模型依赖语言先验。作者提出的高效配方仅用5%计算预算即可达到强生成性能,并训练了13.5B MoE模型在2T tokens上验证结论。论文多模态预训练MoE推荐理由:这篇论文把多模态预训练的内部机制拆开了,告诉你模态之间怎么互相影响、什么时候协同、什么时候拖后腿,还有省算力的训练配方,值得看看。原文稍后读已读值得跟进有用关注 多模态
16:51量子位@鹭羽Sand.ai开源了全球首个千亿参数MoE视频生成模型,总参数达114B,激活参数仅6B。该模型支持生成10秒1080P视频,单次生成成本约为0.5元。这标志着开源视频生成模型进入千亿MoE时代。AI模型Sand.aiMoE视频生成推荐理由:Sand.ai开源了千亿MoE视频生成模型,114B参数只激活6B,跑10秒1080P只要5毛钱,视频生成也卷性价比了。原文稍后读已读值得跟进有用关注 Sand.ai
02:48官方一手marktechpost@Asif RazzaqCursor Research开源了MoK,这是支撑Composer模型的MoE训练内核。MoK将专家混合的全部通信与计算融合进单个确定性内核。在GB300 NVL72机架上,MoK比最强公开基线快2.37倍。它需要Blackwell SM100或SM103 GPU,没有NVL72算力的用户无法使用。AI模型MoKCursorMoE3 个信源在谈事件专题推荐理由:Cursor把训练内核MoK开源了,在GB300 NVL72上比最强公开基线快2.37倍,但得先有NVL72机器才能跑。原文稍后读已读值得跟进有用关注 MoK