07:54官方一手marktechpost@Asif Razzaq83°2026年7月16日,Moonshot AI 发布了 Kimi K3 模型,参数规模达2.8万亿。该模型采用 MoE 架构,包含896个专家,每次推理激活其中16个。Kimi K3 引入了 Kimi Delta Attention 和 Attention Residuals 机制,支持100万token的上下文窗口。模型以开源形式发布。AI模型Kimi K3Moonshot AIMoE10 个信源在谈事件专题推荐理由:Moonshot AI 把 2.8 万亿参数的 Kimi K3 开源了,用了新注意力机制,还有 1M 上下文,直接看技术细节就对了。原文稍后读已读值得跟进有用关注 Kimi K3
00:32官方账号Simon Willison’s Weblog(博客/媒体)精选77°Mira Murati 创立的 Thinking Machines Lab 发布了首个开源权重模型 Inkling。Inkling 是一个总参数 975B、激活参数 41B 的 MoE transformer,采用 Apache-2.0 许可,训练于 45 万亿 tokens 的文本、图像、音频和视频数据。该模型并非前沿模型,而是定位为通过 Tinker 训练平台进行微调的基础模型。Inkling-Small(276B 总参数, 12B 活跃)仍处于测试阶段,权重将后续发布。模型卡和训练数据文档信息较为简略,但 Inkling 在开源生态中可与 Nemotron 和 Gemma 4 竞争。AI模型InklingThinking Machines Lab开源模型10 个信源在谈事件专题推荐理由:Mira Murati 的新实验室发布了 Inkling,975B 参数的 Apache-2.0 多模态开源模型,专门为微调设计,想折腾的开发者可以试试。原文稍后读已读值得跟进有用关注 Inkling
21:16官方账号LMSYS Org (SGLang)@lmsysorg86°Inkling是thinkymachines发布的首个开源MoE模型,总参数量975B,激活参数41B。它支持最高1M上下文长度,原生处理文本、图像和音频。该模型已获得SGLang和Miles的Day 0支持,采用短卷积、相对位置嵌入注意力和共享专家sink MoE等新架构。推理优化包括DFlash投机解码和MXFP8 KV缓存,并支持全参数和LoRA RL训练。AI模型Inklingthinkymachines开源模型10 个信源在谈事件专题推荐理由:thinkymachines开源了一个超大MoE模型Inkling,总参975B但只激活41B,还支持1M上下文和图文音频理解,已经可以在SGLang上跑了,想玩大模型的朋友可以试试。原文稍后读已读值得跟进有用关注 Inkling
12:45官方一手歸藏(guizang.ai)@op741887°Thinking Machine 推出首款模型 Inkling,采用 MoE 架构,总参数量 975B,激活参数 41B,上下文窗口达 1M。模型在 45T 数据上训练,原生支持文本、图像和音频理解。同时发布 Small 预览版,激活参数 12B,且模型开源。后训练数据从 Kimi 2.5 等开源模型蒸馏得到。AI模型Thinking MachineInklingMira Murati10 个信源在谈事件专题推荐理由:Mira Murati 新公司出了开源多模态模型,近 1T 参数但只激活 41B,支持 1M 上下文,还能自己微调,值得试试。原文稍后读已读值得跟进有用关注 Thinking Machine
12:40Junyang Lin@JustinLin610推文讨论了模型战略使用而非技术方法。作者尝试了让MoE以专家模式运行以及设置任务路由器来节省成本,但发现效果不佳。他提出一个粗略标准:对于QA和简单智能体任务(如使用工具一次或两次或修复小bug),应使用较简单模型;对于大型代码项目或ML实验评估,则应使用更强模型。技巧MoETask Router智能体推荐理由:JustinLin610分享了一个实用经验:搞MoE专家路由和任务路由器都不如直接按任务简单/复杂选模型,省心省力。原文稍后读已读值得跟进有用关注 MoE
11:01shao__meng@shao__meng76°Thinking Machines(OpenAI前CTO Mira Murati团队)开源多模态模型Inkling,采用975B参数A41B MoE架构。在开源模型中,Inkling强于Nemotron 3 Ultra和Kimi K2.5,与Kimi K2.6、DeepSeek V4 Pro互有胜负:在IFBench、FORTRESS、SWEBench Verified上略胜,在HLE、SimpleQA、Terminal Bench上略输。整体弱于GLM 5.2,后者在多项基准领先。与闭源模型比,Claude Fable 5和GPT 5.6 Sol在agentic coding和推理上明显领先(SWEBench Verified 95% vs 77.6%),但Inkling在指令遵循上反超(IFBench 79.8% > Claude 63.5%)。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Mira Murati团队开源了多模态模型Inkling,975B参数,比Nemotron和Kimi K2.5强,指令遵循甚至超Claude,值得一试。原文稍后读已读值得跟进有用关注 Inkling
07:51官方一手marktechpost@Asif Razzaq74°2026年7月15日,Thinking Machines Lab 发布其首个从头训练的模型 Inkling。Inkling 拥有 975B 总参数、41B 激活参数,采用 Mixture-of-Experts 架构,原生支持文本、图像和音频输入,上下文窗口达 1M token。模型权重基于 Apache 2.0 许可开源,实验室明确它并非当下最强模型,而是定位为定制基础,其可控思考努力(Controllable Thinking Effort)是主要差异化功能。AI模型InklingThinking Machines LabMoE10 个信源在谈事件专题推荐理由:Inkling 让你能控制模型思考深度,975B 参数但只激活 41B,适合做定制化基础模型。原文稍后读已读值得跟进有用关注 Inkling
05:09官方一手marktechpost@Asif RazzaqSoofi Consortium 发布开源混合 Mamba-Transformer 混合专家模型 Soofi S 30B-A3B,总参数量 31.6B,每次推理仅激活 3.2B 参数。该模型专为德语和英语双语言优化,采用 Mamba 状态空间模型与 Transformer 注意力机制的混合架构。模型权重与训练代码已开源,研究者和开发者可直接下载使用。AI模型Soofi S 30B-A3BSoofi ConsortiumMamba-Transformer推荐理由:Soofi 出了一款开源模型,31.6B参数只激活3.2B,混合Mamba+Transformer架构,支持德语和英语,适合多语言场景。原文稍后读已读值得跟进有用关注 Soofi S 30B-A3B
03:40elvis@omarsar0精选Thinking Machines推出Inkling,一个975B参数(41B活跃)的MoE Transformer模型。它原生支持文本、图像和音频多模态处理。上下文长度提供64K和256K两种版本。完整权重已开放,可在Tinker平台进行微调。用户还能通过Inkling Playground直接体验。AI模型InklingThinking MachinesMoE10 个信源在谈事件专题推荐理由:Thinking Machines开源了975B参数的MoE模型Inkling,支持多模态和64K/256K长上下文,还能在Tinker上微调,值得试试。原文稍后读已读值得跟进有用关注 Inkling
09:46官方一手arXiv: DeepSeek@Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu精选稀疏混合专家(MoE)模型在扩展LLM时依赖专家激活模式,现有投机解码忽视专家激活成本,导致专家散射增加内存流量。EcoSpec通过轻量级专家预测器和动态专家缓冲区,在保持高接受率前提下优先复用了当前验证集的专家路径。在DeepSeek-V3.1(671B)、Qwen3-235B-A22B、GPT-OSS-120B三个大规模MoE模型上,于推理、编码、问答和对话基准测试中,EcoSpec持续减少活跃专家足迹,最高实现1.62倍解码速度提升。论文EcoSpecMoE投机解码推荐理由:这篇论文提出EcoSpec,在DeepSeek-V3.1等MoE模型上通过成本感知投机解码最高提速1.62倍,值得关注。原文稍后读已读值得跟进有用关注 EcoSpec
09:45官方一手arXiv: DeepSeek@Zheng Yu本论文在16设备华为Ascend 910系统上使用CANN和vLLM-Ascend部署了两个大模型推理负载:基于W8A8 MoE模型DeepSeek-V4-Flash的LLM-as-a-judge安全对齐评估流水线,以及基于DeepSeek-V4-Flash-Vision的多模态医学视觉基准测试(MMMU和MMMU-Pro)。为保证运行可靠性,需要12个源码级补丁,并关闭多个高吞吐特性以维持数值正确性。论文总结了8类平台限制:不完整算子支持、脆弱并行、低阶内核数值错误、图编译不成熟、不稳定高级特性、可扩展性差、可观测性弱和生态碎片化。同时量化了集成工作量、并发行为和基准质量,验证了负载的正确性。论文Huawei AscendDeepSeek-V4-FlashLLM-as-a-judge1 个信源在谈事件专题推荐理由:这篇论文实测了华为昇腾跑MoE和多模态大模型的工程代价——需要打12个补丁、关掉一堆特性才能不出错,想用非GPU加速器的团队先看看这个。原文稍后读已读值得跟进有用关注 Huawei Ascend
16:52官方一手marktechpost@Asif Razzaq73°NVIDIA发布Nemotron-Labs-3-Puzzle-75B-A9B,这是Nemotron-3-Super的压缩变体。通过Iterative Puzzle方法,总参数从120.7B降至75.3B,活跃参数从12.8B降至9.3B。在单台8xB200节点上,它实现了2.03倍于Super的总吞吐量,每用户100 tok/s。在H100上,1M-token并发从1提升到8。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA把这个MoE模型压到75B,吞吐翻倍,用户延迟不变,适合降本增效。原文稍后读已读值得跟进有用关注 Nemotron
15:11IT之家(博客/媒体)精选蚂蚁灵波科技开源LingBot-Video,这是全球首个基于MoE架构的面向具身智能视频生成基础模型。模型总参数30B,生成时仅激活约3B,推理效率是同等Dense架构的3倍。训练数据包含7万小时机器人相关数据,结合多维强化学习奖励系统。在RBench基准上总分0.620,超越Wan2.6(0.607)、Seedance 1.5 Pro(0.584)等模型。可用于机器人动作预测、仿真数据生成等方向。AI模型LingBot-Video蚂蚁灵波MoE推荐理由:蚂蚁灵波开源了LingBot-Video,专为机器人设计,RBench上超过Wan2.6,推理快3倍,适合做训练数据。原文稍后读已读值得跟进有用关注 LingBot-Video
15:00量子位@十三该模型采用MoE架构,专为机器人具身场景设计。它首次将混合专家模型用于视频生成与动作控制的融合。模型已开源到GitHub,参数量为7B。在RoboCasa基准上取得了领先成绩。AI模型MoE具身智能视频生成推荐理由:这是首个专门给机器人做的MoE视频模型,能看懂视频并规划动作,还开源了,做具身智能的值得看看。原文稍后读已读值得跟进有用关注 MoE
03:41AK@_akhaliq精选LingBot-Video 是一个基于混合专家(MoE)架构的视频基础模型,专为具身智能设计。模型总参数量达 30B,推理时仅激活 3B 参数。它在大型互联网视频预训练基础上,额外使用了 70K 小时的具身数据进行增强。该模型已在 Hugging Face 平台公开发布。AI模型LingBot-VideoMoEHugging Face推荐理由:LingBot-Video 刚上 Hugging Face,30B 参数但推理只激活 3B,还加了 7 万小时具身数据,适合做机器人视觉。原文稍后读已读值得跟进有用关注 LingBot-Video
03:32elvis@omarsar0精选72°LingBot-Video是首个基于MoE的具身智能视频基础模型,总参数量30B,推理时仅激活3B。模型在70K小时具身数据上微调,并集成大规模互联网视频预训练。在RBench基准上,LingBot-Video超越了Wan2.6、Seedance 1.5 Pro和Cosmos3 Super。其设计优化物理推理而非视频画质,通过稀疏激活大幅降低长视频推理成本。AI模型LingBot-VideoMoERBench推荐理由:LingBot-Video开源了!MoE架构30B参数推理只要3B,物理推理基准超Wan2.6。做具身智能的赶紧试试。原文稍后读已读值得跟进有用关注 LingBot-Video
21:27Paul Couvert@itsPaulAi腾讯发布开源模型Hy3,采用295B参数的MoE架构,规模仅为GLM-5.2的一半,但性能与GPT-5.5相当,且优于DeepSeek V4 Pro。该模型在同等参数量级中表现最佳,可媲美万亿级旗舰模型。Hy3提供Apache 2.0许可,免费API开放两周,适合智能体应用场景。AI模型TencentHy3开源模型推荐理由:腾讯Hy3开源模型295B参数,比GLM-5.2小一半却和GPT-5.5打平,还超过DeepSeek V4 Pro,免费API两周,智能体应用很香。原文稍后读已读值得跟进有用关注 Tencent
18:37向阳乔木@vista8精选腾讯发布Hy3模型,采用MoE架构,总参数295B,基于Apache 2.0协议开放商用。相比Preview版,正式版在推理、智能体、长上下文等任务上显著提升。模型虽小但能力已超过700B参数的GLM 5.1。目前Hy3已上线OpenRouter平台,两周内提供免费API使用。AI模型Hy3腾讯MoE推荐理由:腾讯发了个295B的MoE模型Hy3,能力比700B的GLM 5.1还强,还开源可商用,这两周免费试用,值得试试。原文稍后读已读值得跟进有用关注 Hy3
10:31官方账号NVIDIA AI@NVIDIAAI精选74°NVIDIA 开源了 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 模型,总参数量 75.3B,激活参数 9.3B,采用 MoE 架构。该模型从 Nemotron-3-Super-120B 通过 Iterative Puzzle 框架压缩而来,支持 1M token 上下文长度。模型可运行在单张 GB10 显卡上。AI模型NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4NVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA 刚开源的 75B MoE 模型,实际只激活 9.3B 参数,单卡就能跑百万 token 上下文,适合长文档或代码分析。原文稍后读已读值得跟进有用关注 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
09:05官方一手arXiv: DeepSeek@Yihua Liu精选该论文提出Floor-First残差驱动分流工作流,将解码步骤建模为HBM字节、FLOPs、网络字节、网络消息、KV容量五维资源向量,通过求和与最大值计算乐观下界和悲观上界,无需profiler即可判断重叠质量。基于DeepSeek-V3.2 671B MoE/MLA模型在16块NVIDIA H20 GPU上的案例显示,TP16解码受KV容量限制约70个并发8K请求;稀疏注意力可移除KV带宽项但容量墙不变;EP16+DP-attention布局将容量墙提升至约644,但单流延迟比TP布局慢2.4倍。该方法通过壁排序比较部署方案,替代点基准,并支持新注意力或状态空间模块的扩展。论文DeepSeek-V3.2H20LLM推理优化3 个信源在谈事件专题推荐理由:不用跑一堆配置,用公式就能算清LLM服务的瓶颈在哪,还拿DeepSeek-V3.2在H20上做了实测,对推理优化的人很有参考价值。原文稍后读已读值得跟进有用关注 DeepSeek-V3.2
08:54官方一手marktechpost@Asif RazzaqNVIDIA发布了Nemotron-Labs-Audex-30B-A3B(Audex)模型,这是一个混合专家(MoE)架构,统一了音频理解、语音识别、翻译、文本转语音和音频生成五种能力。该模型以Nemotron-Cascade-2为骨干,仅在音频任务上产生边际的性能回归。Audex在30B总参数中仅有3B活跃参数,高效实现了多模态融合。AI模型AudexNVIDIA多模态10 个信源在谈事件专题推荐理由:NVIDIA发了款新模型Audex,能同时搞定音频理解、语音识别、翻译、TTS和音频生成,而且几乎没牺牲原有文本模型的性能。原文稍后读已读值得跟进有用关注 Audex
02:16elvis@omarsar0精选NVIDIA发布论文,将混合MoE模型Nemotron-3-Super压缩为Puzzle-75B-A9B,活跃参数降至9B。在单个8xB200节点上,交互式服务器吞吐量约为原模型2倍。在H100 GPU上,1M token并发数从1请求提升至8。在推理、编程、长上下文和智能体基准上精度保持。该方法联合优化异构MoE剪枝、活跃参数预算和Mamba剪枝,结合蒸馏、强化学习、量化与多令牌预测头。AI模型Puzzle-75B-A9BNemotron-3-SuperMoE10 个信源在谈事件专题推荐理由:英伟达把大MoE模型压到9B活跃参数,吞吐量翻倍,智能体应用部署成本大幅下降,适合模型高效推理场景。原文稍后读已读值得跟进有用关注 Puzzle-75B-A9B
16:53@koltregaskes@koltregaskes78°Bleys 根据公开信息估算,OpenAI 的 GPT-5.6 Sol 模型总参数在 2-4 万亿之间,采用 MoE 架构,每任务激活约 1500 亿参数。模型被分布在 70-100 个 Cerebras 晶圆上,每晶圆是一个巨型芯片,全模型约 70-90 层,最多每晶圆一层以避免瓶颈。由于专为 Cerebras 芯片设计,推理速度可达 750 tokens/s,但使用成本可能比现有模型高出数倍。AI模型GPT-5.6 SolCerebrasMoE10 个信源在谈事件专题推荐理由:Bleys 算了一笔账:GPT-5.6 Sol 参数 2-4 万亿、跑在 Cerebras 晶圆上、速度 750 token/s,但价格可能翻倍。想了解下一代超大规模模型怎么造?看这个。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
16:09AI Will@FinanceYF573°xAI SGLang负责人在23分钟演讲中详解如何在10万张GPU上部署Grok模型。他们通过拆分Prefill与Decode阶段,将MoE专家分片到不同GPU。采用按专家路由Token的方式让通信与计算重叠执行。最终以低于DeepSeek API的定价对外提供服务。技巧xAIGrokSGLang推荐理由:想了解超大规模GPU集群如何搞推理?xAI的SGLang负责人手把手教你拆分、分片和通信重叠,还比DeepSeek API更便宜。原文稍后读已读值得跟进有用关注 xAI
14:00官方一手marktechpost@Asif Razzaq精选腾讯Hy团队发布Hy3,一个总参数量295B的混合专家(MoE)模型,每个token仅激活21B参数。Hy3在SWE-Bench Verified上取得78.0分,报告更低的幻觉率,并支持256K上下文窗口。该模型以Apache 2.0许可证开源,可在OpenRouter上免费试用至2026年7月21日。AI模型Hy3腾讯MoE推荐理由:腾讯刚开源Hy3,激活21B参数就能在SWE-Bench拿到78.0,还支持256K长上下文,想尝鲜推理模型的话OpenRouter上免费到7月21日。原文稍后读已读值得跟进有用关注 Hy3
11:48官方一手arXiv: DeepSeek@Xiao Shi, Yingying Sun, Jiangsu Du, Zhiguang Chen, Yutong LuCAP框架通过协同激活驱动的专家放置减少跨设备通信,并引入通信感知剪枝选择性移除路由目标。在单节点和多节点实验中,相比DeepSeek EPLB和vLLM的序列放置,吞吐量提升1.23倍至1.86倍。该方法在达到相同加速目标时能保持更好的模型准确率。论文CAPMoEDeepSeek EPLB推荐理由:这篇论文提出CAP,直接在专家放置和剪枝中考虑通信开销,实测比DeepSeek EPLB快1.2-1.8倍,适合跑大MoE模型的人。原文稍后读已读值得跟进有用关注 CAP
11:21官方账号Nous Research@NousResearch精选腾讯混元发布新模型Hy3,参数量295B,采用MoE架构。Hy3在Nous Portal上免费开放两周。该模型专注于低成本智能体应用,在编码、工具调用可靠性、推理以及256K长上下文任务上表现突出。AI模型Hy3腾讯混元MoE推荐理由:腾讯混元这个Hy3模型挺牛的,295B参数还免费玩两周,编码和工具调用都很强,值得试试。原文稍后读已读值得跟进有用关注 Hy3
08:39官方账号Simon Willison’s Weblog(博客/媒体)73°腾讯Hy团队发布Hy3模型,这是一个295B参数MoE架构,激活参数为21B,MTP层参数3.8B。Hy3在多项基准测试中超越同尺寸模型,并媲美2-5倍参数的开源旗舰模型。该模型支持256K上下文长度,FP8量化版本大小为300GB。目前Hy3在OpenRouter上免费开放至2026年7月21日。AI模型Hy3Tencent开源模型推荐理由:腾讯开源了Hy3,295B MoE模型只激活21B参数,性能就能跟更大模型比。OpenRouter上免费试用到7月21日,赶紧去玩玩。原文稍后读已读值得跟进有用关注 Hy3
07:49Hunyuan@TXhunyuan精选腾讯混元推出Hy3模型,总参数量295B,采用MoE架构。该模型在同类尺寸中性能最佳,可媲美万亿参数旗舰模型。支持Apache 2.0开源协议,并提供两周免费API体验(通过OpenRouter)。适用于大多数智能体场景。AI模型Hy3腾讯混元开源模型推荐理由:腾讯混元新出的Hy3,295B参数量就能比肩万亿参数的大模型,还免费给你用两周,开源随便商用,搞智能体的别错过。原文稍后读已读值得跟进有用关注 Hy3
01:59官方账号vLLM@vllm_project精选腾讯混元发布Hy3模型,作为Hy3 Preview的完整版,总参数295B,活跃参数仅21B,采用192专家MoE架构与top-8路由。该模型在vLLM从第一天起即原生支持,包含工具调用、推理解析器和MTP推测解码功能。上下文窗口达256K,配备3.8B MTP推测解码层,提供BF16和FP8权重。模型采用Apache 2.0许可证,已在NVIDIA和AMD硬件上验证。AI模型Hy3vLLM腾讯混元8 个信源在谈事件专题推荐理由:腾讯混元的Hy3,295B参数但只激活21B,vLLM第一天就支持,能跑工具和长推理,Apache 2.0随便使,值得一试!原文稍后读已读值得跟进有用关注 Hy3
01:54官方账号vLLM@vllm_project76°MistralAI 推出了 Leanstral 1.5,一个基于 Apache-2.0 许可证的 Lean 4 证明智能体。该模型采用 MoE 架构,总参数量 119B,仅激活 6B 参数。它在 miniF2F 上获得 100% 准确率,在 FATE-H 和 FATE-X 上分别达到 87% 和 34% 的新 SOTA。在 PutnamBench 上,它解决了 587/672 个问题,每问题成本约 4 美元。现在可通过 vLLM 进行部署。AI模型MistralAILeanstral 1.5vLLM推荐理由:MistralAI 的 Leanstral 1.5 用 6B 活跃参数就拿下 miniF2F 满分,每个问题才 4 美元,做数学证明的可以试试。原文稍后读已读值得跟进有用关注 MistralAI
20:54shao__meng@shao__meng72°腾讯混元发布开源模型 Hy3,采用 295B 总参数、21B 激活参数的 MoE 架构,支持 256K 上下文窗口。相比 Hy3 preview,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%。文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。模型已在元宝、QQ 浏览器、微信读书等腾讯产品中应用。AI模型混元Hy3腾讯MoE推荐理由:腾讯开源了 Hy3,295B 参数的 MoE 模型,256K 上下文,任务成功率直接拉到 90%,比预览版强不少,成本还低。原文稍后读已读值得跟进有用关注 混元Hy3
09:44官方一手arXiv: DeepSeek@Yongqin Zeng, Sicheng Pan, Jiale Wang, Hai-tao Zheng, Hong-Gee Kim, Chunxia Ma, XiuTeng Zhou该论文提出Generic TB-Coverage方法,仅使用WikiText2和C4两个通用语料进行校准。通过分别评估每个语料库上的专家效用并执行固定预算覆盖规则来构建剪枝掩码。在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base上,以25%、50%、75%的保留预算测试,六个零样本基准的平均准确率均优于随机剪枝、REAP和ExpertSparsity,同时WikiText2和C4的困惑度退化更小。在激进剪枝(25%和50%保留)下增益最为显著。论文MoE专家剪枝Qwen1.5-MoE推荐理由:这篇论文用两个通用语料就能做好MoE剪枝,在Qwen和DeepSeek模型上准确率更高,尤其适合需要极限压缩的场景。原文稍后读已读值得跟进有用关注 MoE
13:38官方账号arXiv cs.AI@Jithin S., Roshin Sleeba C., Anvin Mariya P. B., Asmitha K. A., Vinod P., Serena Nicolazzo, Antonino Nocera该论文提出一个基于混合专家(MoE)架构的统一多任务恶意软件分析框架,同时在高维EMBER特征集和原始1D字节数组上处理三种任务:恶意软件家族分类、加壳/未加壳检测、恶意/良性识别。研究了Homogeneous MoE、Heterogeneous MoE和Multi-Gate MoE(MMoE)三种变体,在原始和变异样本上评估对抗鲁棒性。MMoE模型取得最佳性能,综合检测率0.9744,失败率仅2.56%,且在分布偏移下表现出更强的鲁棒性。结果表明专家专业化和任务特定路由能有效应对复杂恶意软件分布。论文MoEEMBER恶意软件分类推荐理由:这篇论文用MoE同时干分类、查加壳、判黑白三种活,检测率97.44%,比单模型稳多了,做恶意软件方向的值得看。原文稍后读已读值得跟进有用关注 MoE
13:23shao__meng@shao__meng77°美团发布LongCat-2.0,采用1.6T参数MoE架构,激活参数48B,上下文窗口1M(最大输出128K),使用5-6万张国产加速卡训练,全过程不依赖英伟达。模型在Terminal-Bench 2.1上得70.8,SWE-bench Pro 59.5(超过GPT-5.5的58.6)。其稀疏注意力与跨层索引技术支撑长上下文,并自研底层算子弥补国产芯片短板。LongCat-2.0定位Agent与编程任务,已在OpenRouter上提供预览。AI模型LongCat-2.0MeituanMoE2 个信源在谈事件专题推荐理由:美团搞了个纯国产卡训练的1.6T MoE模型,激活参数48B,1M上下文,编程和Agent场景表现强,在SWE-bench Pro上还超过了GPT-5.5,值得编程开发者试试。原文稍后读已读值得跟进有用关注 LongCat-2.0
12:39官方一手arXiv: DeepSeek@Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou精选Agents-A1是一个35B参数的Mixture-of-Experts智能体模型,通过扩展智能体视野(平均轨迹长度45K tokens)达到万亿参数级别性能。它在SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和MolBench-Bind(56.8)上超越了1T参数的Kimi-K2.6和DeepSeek-V4-pro,在SciCode(44.3)、HLE(47.6)和BrowseComp(75.5)上也具有竞争力。训练采用三阶段流程:全领域SFT、领域级教师模型、多教师领域路由在线蒸馏。AI模型Agents-A135B智能体推荐理由:35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。原文稍后读已读值得跟进有用关注 Agents-A1
11:00IT之家(博客/媒体)73°美团今日发布LongCat-2.0,总参数1.6T,平均激活约48B,动态范围33B-56B,原生支持1M超长上下文。该模型在五万卡国产算力集群上完成全流程训练,预训练数据规模超30T tokens。其在SWE-bench Pro中得分59.5,领先Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)和Claude Opus 4.6(57.3);在SWE-bench Multilingual中取得77.3,接近Claude Opus 4.6。推理阶段采用LongCat Sparse Attention和零计算专家机制,实现token级动态激活,降低解码延迟。AI模型LongCat-2.0美团MoE2 个信源在谈事件专题推荐理由:美团开源了LongCat-2.0,国产芯片跑万亿参数,编程和Agent能力很强,还支持百万上下文,值得上手试试。原文稍后读已读值得跟进有用关注 LongCat-2.0
10:36官方一手arXiv: DeepSeek@Hui Zang, Pengfei Xia, Hong Liu, Jiajia Chu, Tuo Hao, Minghao Chen, Rui Zhang, Ziyang Zhang精选Mixture-of-Experts (MoE)架构通过稀疏激活扩展模型规模,但数据移动瓶颈导致推理效率低下。两个关键问题:低贡献专家带来几乎均等的内存与传输成本(成本收益比低),以及多设备部署中受最慢设备限制。CAEE框架利用轻量级成本模型估算硬件开销,选择性剪枝低重要性高成本专家,并通过低开销补偿机制避免额外数据传输。在DeepSeek-R1(671B参数)上的评估显示,CAEE将端到端推理延迟降低8%-18%(专家卸载与设备内执行),模型准确率下降小于1%。论文CAEEMoEDeepSeek-R1推荐理由:CAEE框架能降低MoE模型推理延迟8%-18%,且准确率几乎不受影响。DeepSeek-R1用户可重点关注。原文稍后读已读值得跟进有用关注 CAEE
13:00量子位@鱼羊英伟达开源了一款新的MoE加速库,只需一行import即可集成到Transformers v5中。微调速度提升3.7倍。该库支持专家并行技术,并整合了DeepEP和TransformerEngine组件。用户无需修改现有代码即可获取显著性能提升。AI模型英伟达MoETransformers v5推荐理由:想让你HuggingFace上的MoE模型微调更快?英伟达这个新库一行代码就能加速3.7倍,直接用。原文稍后读已读值得跟进有用关注 英伟达
10:31官方账号arXiv cs.LG@Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi论文提出MD Decoupling优化器修改方法,将每个权重分解为超球面上的固定范数方向与可学习的每行每列幅度增益,以解耦幅度和方向的更新。该方法与Adam和Muon等基础优化器兼容,消除了对权重衰减和warmup的需求。实验表明,MD Decoupling在宽模型和大型MoE模型上均优于精心调优的基线,并允许跨模型宽度直接迁移学习率而不需重新调参。论文MD DecouplingAdamMuon推荐理由:这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。原文稍后读已读值得跟进有用关注 MD Decoupling