11:24向阳乔木@vista8MoE(Mixture of Experts)是一种神经网络架构,顶级模型如 Fable5、GPT 5.6 sol 均采用此设计。该架构通过门控网络动态激活部分专家,在保持推理效率的同时扩展模型容量。当前主流大模型如 Mixtral 8x7B 也基于 MoE,印证了其在性能与成本间的平衡能力。技巧MoE混合专家模型Fable51 个信源在谈事件专题推荐理由:想搞懂大模型为什么这么快?这个帖子用 Fable5 和 GPT 5.6 sol 当例子,把 MoE 的原理拆明白了,适合入门原文稍后读已读值得跟进有用关注 MoE
12:04向阳乔木@vista8一条Vista的推文列出了当前模型排行。Fable5位列第一,GPT 5.6 sol第二,Kimi K3第三,Grok 4.5第四,GLM 5.2第五。推文还指出GLM 5.2参数约750B,猜测若增加至1T~10T可能效果更好。同时对比了OpenAI研究员与Kimi研究员可用的算力资源差异。行业Fable5GPT 5.6 solKimi K310 个信源在谈事件专题推荐理由:看看新模型排行,Fable5和GPT 5.6 sol都靠前,Kimi K3排第三,智谱GLM才750B参数,潜力不小。原文稍后读已读值得跟进有用关注 Fable5