03:16官方一手marktechpost@Asif Razzaq精选73°Z.ai和Qwen两家中国AI实验室独立发布了几乎相同的模型架构。GLM-5.3-Flash和Qwen3.8-Flash-Next都采用了3:1线性混合架构。两家模型都使用了压缩索引器和门控残差设计。它们还都采用了Muon训练方法。AI模型GLM-5.3-FlashQwen3.8-Flash-NextZ.ai9 个信源在谈事件专题推荐理由:两家中国实验室不约而同开发出相似架构,看看GLM和Qwen的最新flash版本有何异同。原文稍后读已读值得跟进有用关注 GLM-5.3-Flash
06:23官方账号阿里通义 Qwen@Alibaba_QwenQwen模型进行四大升级,包括GDN+QSA混合注意力机制、Gated Residual增强信息流、N-gram Embedding扩展容量和Muon优化器提升效率。AI模型Qwen模型注意力机制模型架构推荐理由:Qwen模型升级,带来更高效的注意力机制和优化器,提升模型性能和稳定性。和同类模型相比,Qwen在处理长序列时更具优势。原文稍后读已读值得跟进有用关注 Qwen模型
22:28IT之家(博客/媒体)78°智谱上线开源GLM-5.3-Flash模型,参数量320B,激活参数18B,能力超GLM-5.2,限时折扣价为GLM-5.3的1/20。Ox-Alpha测试表现优异,模型架构优化,支持多模态预训练语料。AI模型GLM-5.3-Flash智谱开源模型10 个信源在谈事件专题推荐理由:智谱新开源模型GLM-5.3-Flash,性能强,价格低,值得一试。原文稍后读已读值得跟进有用关注 GLM-5.3-Flash
22:06orange.ai@oran_ge71°Qwen4 将推出新一代架构,同时多款模型厂商也在更新架构。Qwen3.8-Flash-Next 即将开放发布,敬请期待。AI模型Qwen4模型架构新一代10 个信源在谈事件专题推荐理由:Qwen4 新架构即将到来,看看和之前的版本有什么不同吧!原文稍后读已读值得跟进有用关注 Qwen4
10:15官方账号arXiv cs.LG@Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng LiDeaMoE是一种解码高效混合专家架构,将专家按专业领域分组为部门,同部门专家共享大部分参数,并各自保留少量私有参数。它采用定制两阶段路由策略,避免冗余加载,大幅提升大模型解码效率。相比vanilla MoE,DeaMoE每步加载权重最多减少50.9%,7B模型在A40上端到端TPOT加速1.33倍。在微基准测试中,DeepSeek-V3在A40和H100上分别达到2.00倍和1.97倍的峰值加速。AI模型DeaMoEMoEDeepSeek-V31 个信源在谈事件专题推荐理由:DeaMoE让MoE小批量解码少搬权重、跑得更快,7B模型在A40上TPOT提速33%,DeepSeek-V3加速近2倍。原文稍后读已读值得跟进有用关注 DeaMoE
10:11orange.ai@oran_ge评论者 oran_ge 在 X 上评价 DSH 是技术自嗨的巅峰之作。他认为 Transformer 在某种意义上也属于同类。这条推文目前获得 1 个喜欢和 1152 次浏览。AI模型DSHTransformer模型架构推荐理由:有人发推吐槽 DSH 和 Transformer 都是技术自嗨,虽然只有 1152 次浏览,但观点值得围观。原文稍后读已读值得跟进有用关注 DSH
09:18官方一手arXiv: DeepSeek@Jia Peng Lim, Hai Leong ChieuDeepSeek的Engram条件记忆模块在存储与推理之间做权衡,但依赖token级N-gram哈希,导致不同tokenizer需从头训练。论文提出用多项式哈希替换XOR哈希,建立跨N的联合嵌入空间。实验显示该改动在保持性能的同时实现tokenizer无关性,字节等价序列哈希相等。论文DeepseekEngramTokenizer推荐理由:DeepSeek改了Engram的哈希方式,不同tokenizer之间不用再各自训练,效果还一样,做多语言模型的可以看看。原文稍后读已读值得跟进有用关注 Deepseek
13:00向阳乔木@vista8Gated Delta Networks 是一种基于Mamba架构的新模型设计,被用于英伟达Nemotron、Kimi Delta Attention以及Qwen的最新模型中。这种混合架构通过融合注意力机制与状态空间模型,使得参数规模可达到万亿级别(T)的同时保持高推理质量。论文展示了其在长序列任务上的显著效率提升,相比纯Transformer架构可减少80%的计算开销。多款万亿参数模型已采用该架构,验证了其可扩展性。论文Gated Delta NetworksMambaNemotron推荐理由:这篇论文解释了为什么最近万亿参数模型(比如Nemotron、Kimi、Qwen)能又大又好——Gated Delta Networks混合了Mamba和注意力,效率翻倍还不掉精度。原文稍后读已读值得跟进有用关注 Gated Delta Networks
13:18小互@imxiaohu精选Anthropic内部对谈指出,模型外围的harness正在变薄,其编码的“模型做不到什么”的假设随模型能力提升而过期。旧harness像固定流水线,每个工位顺序执行任务。新harness更像战术教练,根据实际战况选择阵型。这种变化反映了模型能力跃迁后对控制框架的反思。AI模型AnthropicHarness模型架构4 个信源在谈事件专题推荐理由:Anthropic拆掉了模型外面那层死板的控制代码,换成能随机应变的教练。想了解模型架构演进,可以看看这篇对谈。原文稍后读已读值得跟进有用关注 Anthropic
13:13官方账号arXiv cs.AI@Reza Bayat, Ali Behrouz, Aaron Courville当前语言模型在深度上均匀分配参数,但研究表明各层贡献不同。该论文在固定预算下实验发现,将更多参数分配给前层、减少后层可以改进困惑度。提出Tapered Language Models(TLMs),通过余弦调度平滑锥形化MLP宽度。在Transformer、Gated Attention、Hope-attention和Titans四种架构上,三个模型尺度均一致提升困惑度和下游基准性能,且不增加参数或计算量。论文Tapered Language ModelsTransformerTitans推荐理由:这篇论文发现了一个简单技巧:同等算力下,把更多参数分给前几层、少给后几层,模型效果就能更好,试了多种架构都管用。原文稍后读已读值得跟进有用关注 Tapered Language Models
12:57官方一手歸藏(guizang.ai)@op7418精选71°Noam Shazeer(Transformer论文作者之一、MoE架构提出者)加入OpenAI,负责模型架构研究。谷歌此前以27亿美元收购Character.AI换取他加入谷歌。但Shazeer在谷歌停留短暂后即转投OpenAI。行业Noam ShazeerTransformerMoE10 个信源在谈事件专题推荐理由:Transformer论文作者Noam Shazeer,MoE提出者,跑到OpenAI研究模型架构了,谷歌27亿美元白花了?原文稍后读已读值得跟进有用关注 Noam Shazeer
23:12Philipp Schmid@_philschmid72°Google 昨日发布 Gemma 4 12B 模型,并附有详细架构图解。该模型创新性地移除了视觉和音频编码器,仅用一个 12B 参数模型即可处理文本、图像和音频,无需独立的编码器模块。图解展示了编码器通常如何连接模态与大语言模型,以及 Gemma 4 如何通过单一模型实现多模态理解。这一设计简化了模型结构,降低了部署复杂度,对多模态 AI 研究者和开发者具有重要参考价值。AI模型Gemma 4多模态模型架构10 个信源在谈事件专题推荐理由:多模态模型架构的一次简化尝试,做模型部署或边缘推理的团队值得看看图解,理解无编码器方案如何降低资源开销。原文稍后读已读值得跟进有用关注 Gemma 4
19:11官方账号arXiv cs.LG@Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan LiuDECO是一种针对端侧设备设计的稀疏MoE架构,旨在相同参数预算和训练Token数下达到稠密Transformer的性能。它采用可微分灵活的ReLU路由和可学习专家缩放,结合新激活函数NormSiLU,提高了路由专家激活比率的稳定性和内在稀疏性。实验显示,仅激活20%专家即可匹配稠密模型性能,专用加速核在真实硬件上相比稠密推理加速3倍。这一工作对推动MoE在资源受限设备上的实际部署具有重要意义。论文稀疏MoE端侧部署推理加速推荐理由:DECO在保持性能和降低计算开销方面取得了良好平衡,其3倍加速和严格的稀疏性控制对端侧AI部署具有实际参考价值。原文稍后读已读值得跟进有用关注 稀疏MoE