8月5日
01:31
01:31官方账号Cursor@cursor_ai
72°
Cursor AI 开源了 Mixture-of-Kittens (MoK) 训练内核。该内核面向 NVIDIA NVL72 平台,将全部 MoE 通信与计算融合为单个确定性内核。相比最强公开基线,MoK 的训练速度最高可提升 2.37 倍。开发者现在可以获得完整代码并用于自己的训练任务。
事件专题

推荐理由:Cursor 把 NVL72 上的 MoE 训练内核开出来了,比公开方案快 2.37 倍,想省训练成本直接用。
8月2日
03:08
03:08官方一手marktechpost@Asif Razzaq
AMD推出Instella-MoE-16B-A3B,这是一个完全开源的混合专家语言模型,总参数16B,每个token仅激活2.8B。模型采用Gated MLA与FarSkip-Collective架构,在Instinct MI300X和MI325X GPU上从零训练。AMD已发布所有训练阶段的权重,并公开数据混合、配置和推理代码。
推荐理由:想用AMD显卡跑大模型的可以看看,AMD把16B总参数、2.8B激活的MoE模型全开源了,连训练配置和数据配方都给了。
7月31日
7月30日
13:32
13:32官方一手marktechpost@Michal Sutter
Moonshot AI 在 Kimi K3 Open Day 上开源了 MoonEP,这是一个专家并行(EP)通信库,专为分布式 Mixture-of-Experts(MoE)训练优化。该库采用 MIT 许可证发布,旨在解决大规模 EP 通信的效率瓶颈。MoonEP 提供平衡的负载分配和低延迟通信,可与 Kimi K3 等模型配合使用。
事件专题

推荐理由:Moonshot AI 开源了 MoonEP,一个专门加速 MoE 训练中专家并行通信的库,比现有方案更均衡高效,做分布式训练的同学可以试试。
7月28日
16:16
16:16官方一手Pandaily@contact@pandaily.com (Pandaily)
82°
Moonshot AI发布47页Kimi K3技术报告,核心架构包括KDA+Gated MLA混合注意力机制。AttnRes跨层检索层降低推理成本。Stable LatentMoE包含896个专家,支持动态路由。采用51.2M规模的RL沙箱进行强化学习训练,提升模型对齐能力。报告还引入模型参数与推理时间两个缩放轴,重新定义性能前沿。
事件专题

推荐理由:Moonshot AI 发了Kimi K3的47页技术报告,混合注意力、896专家MoE和5100万RL沙箱的架构特别硬核,值得看它怎么跟DeepSeek对标。
13:38
11:47
11:47官方账号arXiv cs.LG@ Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan Cai, Peizhou Cao, Yuxuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Guanduo Chen, Guangyu Chen, Guanzheng Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kexin Chen, Peng Chen, Ruijue Chen, Wentao Chen, Xin Chen, Yang Chen, Yanru Chen, Yifei Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Dazhi Cheng, Yean Cheng, Jialei Cui, Jingbing Cui, Anqi Dai, Jiaqi Deng, Hao Ding, Rui Ding, Shaofeng Ding, Mengfan Dong, Mengnan Dong, Yuhao Dong, Yuxin Dong, Angang Du, Chenzhuang Du, Dikang Du, Jusen Du, Yulun Du, Yu Fan, Jing Feng, Qiulin Feng, Yichen Feng, Kelin Fu, Qiang Fu, Fuxuan Gao, Hongcheng Gao, Jingyue Gao, Tong Gao, Weijia Gao, Shangyi Geng, Jie Gong, Linhu Gong, Shengao Gong, Xiaochen Gong, Qizheng Gu, Yicheng Gu, Shuhao Guan, Haiqing Guo, Shiqi Guo, Xiang Guo, Zhengyan Guo, Beixi Hao, Wenxin Hao, Xiaoru Hao, Dailan He, Haotian He, Lehan He, Qi He, Weiran He, Xinran He, Xinyi He, Yibo He, Yunjia He, Chao Hong, Tiange Hong, Hao Hu, Jiaxi Hu, Ruikun Hu, Weiming Hu, Yangyang Hu, Zhenxing Hu, Liang Hua, Jinbin Huang, Ke Huang, Ruiyuan Huang, Siying Huang, Weixiao Huang, Yan Huang, Zhengjie Huang, Zhiqi Huang, Yulong Hui, Chaobo Jia, Yutong Jiang, Zhejun Jiang, Zuoyou Jiang, Wenyi Jin, Xinyi Jin, Yu Jing, Huanjun Kong, Guokun Lai, Aidi Li, Cheng Li, Chengyuan Li, Cong Li, Fang Li, Guanyu Li, Haoyang Li, Jia Li, Junxiong Li, Lei Li, Letian Li, Lincan Li, Weihong Li, Wentao Li, Xintong Li, Yang Li, Yishen Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Zhengxiao Li, Zhiyuan Li, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zichao Lin, Ziyan Lin, Bill Liu, Boxiao Liu, Chuan Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yipeng Liu, Zhengying Liu, Zhiheng Liu, Enzhe Lu, Haoyu Lu, Linqiang Lu, Tingzhan Lu, Zhiyuan Lu, Aotian Luo, G. Luo, Junyu Luo, Yifan Luo, B. Lyu, Wenzhou Lyu, Shaoguang Mao, Yuan Mei, Xin Men, Minqing Ni, Yixuan Niu, Siyuan Pan, Shujun Peng, Zhangyang Qi, Ruoyu Qin, ZeChao Qin, Zeyu Qin, Haiquan Qiu, Jianxin Qiu, Jiezhong Qiu, Bowen Qu, Yuhao Qu, Zeyu Shang, Youbo Shao, Han Shen, Jincheng Shi, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Wingchun Siu, Pengwei Song, Xiaoxi Song, Jianlin Su, Yunfeng Su, Zhaochen Su, Lin Sui, Jingsong Sun, Junyao Sun, Shaoning Sun, Shuzhe Sun, Tongyu Sun, Yujun Sun, Yunpeng Tai, Chuning Tang, Heyi Tang, Sirui Tang, Zecheng Tang, Chaoran Tian, Rongpeng Tian, Yu Tian, Wei Tu, Chensi Wang, Chuang Wang, Chunjie Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hao Wang, Huaqing Wang, Hui Wang, Jiayi Wang, Jinglong Wang, Jinhong Wang, Jiuzheng Wang, Linian Wang, Shaobo Wang, Shenzhi Wang, Shuyi Wang, Si Wang, Siyuan Wang, Tianfu Wang, Wenjue Wang, Xingran Wang, Xinmei Wang, Xinyuan Wang, Xusheng Wang, Yalin Wang, Yangkun Wang, Yao Wang, Yaoyu Wang, Yejie Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhenhao Wang, Zhongsheng Wang, Zifan Wang, Chu Wei, Ming Wei, Shouxin Wei, Zichen Wen, Fan Wu, Haoning Wu, Rucong Wu, Wenhao Wu, Xiaoxue Wu, Yingcong Wu, Yongqi Wu, Yuxin Wu, Zijian Wu, Xinglang Xian, Chenxuan Xiang, Yuye Xiang, Bocheng Xiao, Chenjun Xiao, Xin Xiao, Jin Xie, Xiaotong Xie, Yifeng Xie, Zhe Xie, Bowei Xing, Yiming Xiong, Baosheng Xu, Boyu Xu, Jiale Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Qingtao Xu, Shuyao Xu, Suting Xu, Tiantian Xu, Tianxiang Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ye Xu, Yueni Xu, Ziyao Xu, Haonan Xue, Junjie Yan, Yaoyao Yan, Fan Yang, Guangyao Yang, Hao Yang, Junwei Yang, Ruoyu Yang, Wenjie Yang, Xiaofei Yang, Xinyu Yang, Yi Yang, Yiling Yang, Ying Yang, Yuchen Yang, Zhen Yang, Zhilin Yang, Zian Yang, Zuhao Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhanbo Ye, Bohong Yin, Haoxiang Yin, Xietong Yin, Chengzhen Yu, Haozhen Yu, Longhui Yu, Shengnan Yu, Shuying Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Tongtian Yue, Wei Yue, Yang Yue, Dunyuan Zha, Haobing Zhan, B. H. Zhang, Dehao Zhang, Fei Zhang, Hao Zhang, Haoyuan Zhang, Huanyu Zhang, Jiapei Zhang, Jiaxuan Zhang, Jin Zhang, Kaiyi Zhang, Miaozhen Zhang, Puqi Zhang, Qinglei Zhang, Rong Zhang, Rui Zhang, Shaoshuai Zhang, Shiyi Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yangkun Zhang, Ye Zhang, Yichi Zhang, Yikun Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Zijing Zhang, Bin Zhao, Chenguang Zhao, Feifan Zhao, Jinglun Zhao, Jinxiang Zhao, Shuai Zhao, Wenshuo Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Haozhi Zheng, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Haofeng Zhong, Lei Zhong, Longguang Zhong, M. Zhou, Qiankang Zhou, Runjie Zhou, Ruozhang Zhou, Xinyu Zhou, Yiqiao Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yangjunfeng Zhu, Yuxuan Zhu, Zhen Zhu, Chen Zhuang, Weiyu Zhuang, Xinxing Zu
Kimi K3是一个2.8万亿参数的Mixture-of-Experts模型,激活参数104B,支持100万token上下文窗口和原生视觉。它采用Kimi Delta Attention和Attention Residuals改进信息流动,训练效率相比Kimi K2提升约2.5倍。后训练中应用了强化学习,覆盖通用、智能体和编程领域,实现组合泛化。在长程编码、智能体、知识、推理和视觉任务上达到前沿水平,但整体性能仍落后于Claude Fable 5和GPT-5.6 Sol。官方已开源完整模型权重。
事件专题

推荐理由:Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。
09:49
09:49官方一手pandaily@contact@pandaily.com (Pandaily)
72°
Moonshot AI 正式开源 Kimi K3 模型,拥有 2.8T MoE 参数、896 个路由专家,每 token 激活 16 个专家,支持 1M 上下文窗口。同时开源 MoonEP、FlashKDA 和 AgentEnv 三项基础设施技术。技术报告与模型权重同步发布。
事件专题

推荐理由:Moonshot AI 发布了 2.8T 参数的 Kimi K3,MoE 架构加 1M 上下文,还配套了工具,开源党可以玩起来了。
7月24日
06:30
06:30官方账号Nous Research@NousResearch
精选
蚂蚁集团(AntLingAGI)发布新MoE模型Ling-3.0-flash,总参数124B,激活参数5.1B,运行速度快。该模型专为智能体工作负载设计,涵盖编码、搜索、研究和工具使用场景。即日起一周内,用户可通过Nous Portal免费使用。

推荐理由:蚂蚁发了新MoE模型Ling-3.0-flash,124B参数但只激活5.1B,跑得快,还免费一周。适合搞智能体、编码或搜索任务,快去体验。
06:09
7月23日
09:55
09:55官方一手arXiv: DeepSeek@Sungrae Park, Sanghoon Kim, Gyoungjin Gim, Jungho Cho, Hyunwoong Ko, Minbyul Jeong, Minjeong Kim, Keunwoo Choi, Chaehun Shin, Chanwoong Yoon, Dongjun Kim, Eunwon Kim, Gyungin Shin, Hyeonju Lee, Hyungkyu Kang, Inseo Song, Jisu Bae, Jiyoon Han, Jiyun Lee, Joonkee Kim, Junyeop Lee, Mikyoung Cha, Sangwon Yu, Sehwan Joo, Seokyoon Kang, Seonghoon Yang, Seung Shin, Seunghyun Lee, Seungseop Lim, Seungyoun Shin, Sukyung Lee, Taegyeong Eo, Taehwan Oh, Taewhoo Lee, Wonho Song, Wonjun Oh, Wonseok Hwang, Yunsu Kim, Yura Shim, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Seungju Han, Yejin Choi, Junsuk Choe, Hwaran Lee, Minjeong Ban, Yun Taewon, Hwanjun Song, Jae-Gil Lee, KyungTae Lim, Alice Oh
Solar Open 2 是一个 250B 参数(15B 激活)的混合专家(MoE)语言模型,上下文窗口达 1M token。它采用混合注意力机制,每 3 层线性注意力插入 1 层 softmax,无位置编码。训练上,从 Solar Open 1 初始化 5.69B 参数共享骨架,并通过质量与稀有度感知的数据筛选将 20T 语料缩减为 10T 以提升效率。通过多教师同策略蒸馏(MOPD)融合 12 个领域专家。在 MMLU-Pro、LiveCodeBench 和 APEX-Agents 上领先,韩语基准平均最高,Ko-GDPval 上以不到 1/6 参数量与 DeepSeek-V4-Pro (1.6T) 竞争。
事件专题

推荐理由:Solar Open 2 发了,250B MoE 模型,1M token 超长上下文,专门跑复杂智能体任务。MMLU-Pro 和 LiveCodeBench 都领先,韩语能力还特别强,比 DeepSeek-V4-Pro 小很多但性能接近。
7月22日
02:49
02:49OpenRouter@OpenRouterAI
PoolsideAI 发布了开放权重的 Laguna S 2.1 模型,采用 118B-A8B 混合专家架构。该模型拥有 1M 上下文窗口,专门用于智能体编码和长时任务。在 Terminal-Bench 2.1 基准上得分 70.2%,在 DeepSWE 上得分 40.4%。模型现已通过 OpenRouter 平台提供使用。
推荐理由:PoolsideAI 出的 Laguna S 2.1,118B MoE 带 1M 上下文,Terminal-Bench 上 70.2%,专搞编码智能体,想试试直接去 OpenRouter 用。
7月20日
10:47
10:23
10:23IT之家博客/媒体
腾讯混元大模型Hy3限时免费活动延长至8月5日,面向WorkBuddy和CodeBuddy用户。Hy3于7月6日开源,采用MoE架构,总参数295B,激活参数21B,支持256K上下文。模型在推理、智能体、长上下文任务上显著进步,性能比肩参数规模2-5倍的更大模型。

推荐理由:腾讯又给了两周免费试用Hy3,到8月5日。这个295B参数的MoE开源模型激活仅21B,但性能能打,适合推理和智能体场景。
09:16
09:16官方账号arXiv cs.AI@Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai
Loopie系列包含两个MoE模型:20B参数(2B活跃)和6B参数(0.6B活跃)。它解决了循环Transformer的经典问题:在预训练计算量增加N倍时,循环N次不如增加参数N倍。实验表明,Loopie显著优于相同计算预算的普通Transformer基线。后训练阶段赋予模型强推理能力,在2025年IMO和IPhO中获得金牌(无外部工具)。
推荐理由:研究者发布了Loopie循环Transformer,用更少活跃参数在IMO和IPhO拿到金牌,比普通模型强很多。
7月19日
09:48
09:48官方一手marktechpost@Michal Sutter
82°
文章对三款开源万亿参数MoE模型Kimi K3、DeepSeek V4 Pro和GLM-5.2进行了全面对比。对比涵盖了在多项基准测试中的表现、采用的MIT或Modified MIT许可证以及实际服务成本。文章提供了这些模型在不同维度上的差异分析,帮助读者了解各模型的优劣势。
事件专题

推荐理由:想选开源万亿模型?这篇直接拿三个主流模型比了基准、许可证和成本,看完就知道选哪个合适。
7月18日
08:09
08:09OpenRouter@OpenRouterAI
Think Machines开发的Inkling模型已上线OpenRouter。该模型采用MoE架构,总参数975B、活跃参数41B。支持1M上下文长度,可处理文本、图像和音频。具备可控推理能力。
事件专题

推荐理由:Think Machines的Inkling模型很特别,总参数975B但只激活41B,还有1M上下文和多种模态支持,值得上手试试。