11:53官方账号arXiv cs.LG@Lintai HouGraph Machine (GM) 是一种保持 O(n) 大小状态的架构,通过稀疏动态路由访问状态。研究人员将 Qwen3-0.6B 中 75% 的密集 Transformer 层替换为 GM 稀疏层,在 157 亿 tokens 上从头预训练。每层每 KV 头仅检索 4096 个 token 中的 2 个时,损失仅略微下降;检索 4 个时,最佳模型损失略有改善。论文Graph MachineQwen3-0.6BTransformer推荐理由:Graph Machine 用边对象替代传统状态,在 Qwen3-0.6B 上预训练时,稀疏层仅需少量检索就能保持性能。原文稍后读已读值得跟进有用关注 Graph Machine
11:07官方账号arXiv cs.LG@Nagur Shareef Shaik, Jeongwoo Park, Yeong-Jin Kim, Jaeuk Jung, Hyunjung Oh, Dong Hye Ye视网膜眼底图像常同时存在多种病理,但标准深度学习分类器对所有图像施加静态相同计算。研究者提出新架构,结合引导上下文门控空间注意力和稀疏路由专家混合模块,实现可解释的数据驱动分解。专家分配显著依赖疾病,健康状态和形态学上不同的病理隔离到专属专家。在五类患者分离的5折交叉验证中,模型达到0.912±0.008宏AUC和0.653±0.014宏F1。Grad-CAM++和t-SNE可视化证实专家路由与局部病灶对齐,并将共病案例映射到其组成簇之间。论文视网膜MoE稀疏路由推荐理由:这篇论文用稀疏MoE做视网膜多病分类,专家分配能对应具体病灶,宏AUC到0.912,搞医学影像的可以看看。原文稍后读已读值得跟进有用关注 视网膜