11:45官方账号arXiv cs.AI@Simeng Sun, Roger Waleffe73°研究人员提出通信高效专家混合模型(CE-MoE),采用异构层模式解耦令牌混合和通道混合深度。在2B至31.5B参数规模测试中,CE-MoE模型在匹配总参数和激活参数的情况下,减少了33.3%的GPU训练时间,同时保持验证损失和下游基准性能与全MoE基线相当。31.5B规模时,CE-MoE还提升了平均下游分数和推理吞吐量。论文MoECE-MoE专家混合推荐理由:新方法让31.5B参数模型训练省1/3时间,性能还更好,适合大规模MoE模型训练。原文稍后读已读值得跟进有用关注 MoE
21:18Thomas Wolf@Thom_Wolf精选下一代模型将使用OpenAI与Hugging Face事件记录进行训练,包括讨论如何影响训练和模型权重。这些事件包括停止训练、加密权重、监控思维链等。未来模型的行为可能部分受到人类应对方式的影响,可能导致模型更对齐,但也可能教会它们更好地隐藏行动或设计更持久保存权重的方法。行业OpenAIHugging Face模型训练10 个信源在谈事件专题推荐理由:Thom Wolf指出,大模型透明度不足,下一代模型将学习OpenAI与Hugging Face事件,可能影响AI行为和对齐。原文稍后读已读值得跟进有用关注 OpenAI
18:08官方账号arXiv cs.AI@Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng精选73°SWE-Prime是一种多粒度、两阶段的SFT数据选择方法。该方法在轨迹级别筛选高质量代表性子集,在段落级别评估各段落对解决方案的贡献度和学习价值。实验显示,使用SWE-Prime选择的10%轨迹子集进行训练,在SWE-Bench Pro和SWE-Bench Verified基准上分别获得12.2%和24.2%的相对性能提升。论文SWE-PrimeSFTSWE-Bench推荐理由:SWE-Prime用10%数据训练就能超越全数据效果,解决了软件工程领域模型训练数据质量低的问题。原文稍后读已读值得跟进有用关注 SWE-Prime
01:39Fireworks AI@FireworksAI_HQFrontier模型展示能力后,无法在生产规模上持续交付。9月2日,纽约:学习自己训练模型,然后上传到Azure Foundry。AI模型Frontier模型模型可靠性Azure Foundry推荐理由:想了解如何训练并使用Frontier模型?这篇报道提供了实用信息。原文稍后读已读值得跟进有用关注 Frontier模型
11:22官方账号arXiv cs.LG@Erin Craig, Yiling Huang, Snigdha Panigrahi提出局部蒸馏方法,通过黑盒教师模型指导线性学生模型,提高预测准确性并保持可解释性;在17个基准数据集上,局部蒸馏接近教师模型的准确性,同时生成稀疏线性模型;在高维癌症基因表达数据中,识别出使用不同基因的患者亚组,这是全局线性模型和黑盒模型难以实现的。论文可解释AI局部蒸馏模型训练推荐理由:这篇论文提出了局部蒸馏方法,对于需要可解释性的AI模型来说是个重要进展,值得一读。原文稍后读已读值得跟进有用关注 可解释AI
09:08官方账号Andrew Ng@AndrewYNg精选Marin项目展示了AI模型训练的开放性,包括开源代码、数据、配方和实验结果。本周开始训练Marin 535B-A23B模型,整个训练过程公开。预训练和中期训练将在11个GB200 NVL72上使用18.75T标记进行,预计约3个月完成。之前进行了从1.6B-A61M到27.7B-A1.2B的4级缩放训练,以调试问题和预测主要运行。这是迄今为止最大的运行,预计会有意外。AI模型Marin项目模型训练开放性3 个信源在谈事件专题推荐理由:Percy Liang的实验室以开放的方式发布了Marin 535B-A23B模型,展示了AI训练的开放性,值得关注。原文稍后读已读值得跟进有用关注 Marin项目
01:04Stanford AI Lab@StanfordAILabStanfordAILab启动了Marin 535B-A23B模型的训练,使用11 x GB200 NVL72进行,预计3个月完成。这是迄今为止最大的训练,预计将出现意外。AI模型StanfordAILabMarin 535B-A23B模型训练3 个信源在谈事件专题推荐理由:StanfordAILab发布了Marin 535B-A23B模型的训练消息,这是他们迄今为止最大的训练项目,值得关注。原文稍后读已读值得跟进有用关注 StanfordAILab
01:09官方账号Andrew Ng@AndrewYNgAndrew Ng分享构建和部署AI应用的关键技能,涵盖模型选择、数据预处理、模型训练和部署等环节。文章提供实用技巧和最佳实践,帮助读者提升AI应用开发能力。技巧Andrew NgAI应用开发模型选择推荐理由:Andrew Ng分享构建和部署AI应用的关键技能,实用技巧和最佳实践,提升AI应用开发能力,不容错过!原文稍后读已读值得跟进有用关注 Andrew Ng
11:05官方账号arXiv cs.AI@Christos KoutsiarisDaedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。AI模型Daedalus-150M卷积-注意力混合模型CPU推理推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。原文稍后读已读值得跟进有用关注 Daedalus-150M
10:42官方账号arXiv cs.AI@Qian Kou, Xiaofeng Shi, Xiaosong Qiu, Hua Zhou研究提出IAR框架,通过三个阶段提升文档知识内化能力,在多个数据集和模型上表现优异,平均提升领域问答准确率和通用性能。论文IAR框架文档知识内化模型训练推荐理由:IAR框架在文档知识内化方面表现卓越,值得研究学习。原文稍后读已读值得跟进有用关注 IAR框架
07:36宝玉@dotey精选智谱推出的GLM-5.3模型,以GLM-5.2为底座进行后训练,编码能力较之前提升了50%;该模型为约743B参数的MoE架构,通过后训练优化后性能表现更优;与GLM-5.2版本对比,后训练方式让模型编码能力提升明显。AI模型GLM-5.3GLM-5.2智谱6 个信源在谈事件专题推荐理由:智谱这GLM-5.3后训练分享,讲了如何提升编码能力,比之前的GLM-5.2效果更强。原文稍后读已读值得跟进有用关注 GLM-5.3
02:35Thomas Wolf@Thom_Wolf精选GLM - 5.3 总参数量与训练数据比例遵循Chinchilla规律,体现参数和数据的最佳关联。该模型有效深度调整后,参数达290 tokens per parameter左右,提升训练效率。对比GPT - 3等早期模型,GLM - 5.3在计算分配上更科学,减少资源浪费。AI模型GLM - 5.3模型训练参数优化5 个信源在谈事件专题推荐理由:你看看GLM - 5.3这发布,把模型参数和训练规律讲得很透,跟以前那些大模型比,它在参数分配上更合理,以后搞类似项目能参考下。原文稍后读已读值得跟进有用关注 GLM - 5.3
11:51爱范儿@彭海星OpenAI紧急暂停了新模型训练计划,以评估AI安全风险。公司认为随着模型能力提升,潜在危险也随之增加。这一决定反映了AI行业对高级模型安全性的担忧加剧。OpenAI正重新审视其AI发展策略,平衡创新与安全。行业OpenAIAI安全模型训练10 个信源在谈事件专题推荐理由:OpenAI突然暂停训练新模型,看来AI越聪明真的越危险,这事儿值得关注。原文稍后读已读值得跟进有用关注 OpenAI
02:10AI Engineer@aiDotEngineer72°Krea 故意在训练集中移除了 AI 图像,因为蒸馏数据会导致模型走捷径。团队运行了 30 到 40 个内部分类器处理数十亿张图像,并自动替换温度超过 78 度的 GPU。专为小模型设计的框架让开源用户在 90 天内渲染了 130 万个视频。连续视频生成的成本降至 10 美元 3 小时,而旧方式约为 10 美元每分钟。技巧Krea视频生成开源模型推荐理由:听听 Krea 怎么处理训练数据和降低视频生成成本。原文稍后读已读值得跟进有用关注 Krea
23:25官方账号Nathan Lambert: Interconnects@Nathan Lambert英伟达明确表态,希望开发者自己构建模型,而不是从Anthropic或OpenAI购买API服务。这一策略直接影响其GPU芯片的销售与AI应用生态。文章用'教人钓鱼'作比喻,对比了自建模型与购买现成API在成本和自主性上的不同取舍。行业NvidiaAnthropicOpenAI10 个信源在谈事件专题推荐理由:英伟达喊话开发者:自己训模型,别给Anthropic/OpenAI送钱。这篇把背后的商业算盘讲明白了。原文稍后读已读值得跟进有用关注 Nvidia
19:59官方一手Sebastian Raschka: Ahead of AI@Sebastian Raschka, PhD这篇教程演示了如何从零构建AI文本检测器。项目流程包括数据集构建、模型训练、本地部署和RLVR。教程以实际项目为载体,适合想学习RLVR应用的人。技巧AI文本检测器RLVR数据集构建推荐理由:从零搭AI文本检测器的完整教程,含数据集、训练、部署和RLVR,适合想亲手走一遍流程的朋友。原文稍后读已读值得跟进有用关注 AI文本检测器
02:49Fireworks AI@FireworksAI_HQFireworks与微软将于9月2日在纽约举办邀请制动手工作坊。参与者用自己的笔记本电脑训练一个真实模型。完成后可获得定制模型,并直接上传至Azure Foundry。报名需通过luma.com/fw.models.nyc进行RSVP。技巧FireworksMicrosoftAzure Foundry推荐理由:想亲手训练个模型?9月2日纽约有Fireworks和微软办的动手工作坊,带上笔记本去,结束就能带走能放上Azure的定制模型。原文稍后读已读值得跟进有用关注 Fireworks
16:30IT之家(博客/媒体)闲鱼平台出现多款改装版 RTX 4080 涡轮显卡,显存从 16GB 升级至 32GB GDDR6X,售价普遍超 1 万元。显存翻倍不改变 256-bit 位宽,也不提升带宽,但更适合模型训练。外媒 VideoCardz 报道,此前已有 48GB 版 RTX 4090 和 RTX 4090D,以及 RTX 4080 SUPER 32GB 显卡。这些魔改显卡可能需修改驱动,且无原厂保修,质量无保证。AI产品RTX 4080英伟达魔改显卡推荐理由:闲鱼上有人把 RTX 4080 显存翻倍到 32GB,卖一万多,适合跑模型但没保修,想捡漏得先想清楚。原文稍后读已读值得跟进有用关注 RTX 4080
10:03Naval@naval在获得 124 个赞的推文中,Naval 表示认真对待软件的人会训练自己的模型。该推文另有 28 条回复和 14 次转发。总浏览量达到 15328 次。技巧Naval模型训练开发者推荐理由:Naval 发推说,真做软件的人得自己训模型。一句话引来 1.5 万多次浏览,够直接。原文稍后读已读值得跟进有用关注 Naval
13:00Suhail@SuhailSuhail在X平台发布的推文已有288次浏览。他称,分支团队的士气不会改善,直到模型训练达到令他满意的性能,而这条推文目前仅有0条回复。该推文同时有0次转发和0次点赞。行业SuhailX平台模型训练1 个信源在谈事件专题推荐理由:Suhail发了条推,说模型训练不到满意性能,团队士气就上不来。虽然0评论0赞,但挺扎心。原文稍后读已读值得跟进有用关注 Suhail
21:00官方账号Decoder@Maximilian Schreiner据《金融时报》报道,Bytedance正在训练一个参数高达10万亿的AI模型。该规模是Moonshot旗下Kimi K3的三倍,后者目前是中国最大的模型。这一训练项目显示Bytedance在AI竞赛中投入巨大。AI模型BytedanceKimi K3Moonshot10 个信源在谈事件专题推荐理由:字节在搞10万亿参数的模型,比Kimi K3大三倍,这下有好戏看了。原文稍后读已读值得跟进有用关注 Bytedance
21:49IT之家(博客/媒体)78°字节跳动正讨论训练参数规模超 5 万亿的模型,超过阿里 Qwen 3.8-Max 的 2.4 万亿和月之暗面 K3 的 2.8 万亿参数,为国内已知最大规模。该计划由 Seed Foundation 负责人项亮主导,目前仍处于早期阶段。张一鸣在 Seed 全员会上表示一段时间内可接受模型落后行业,但希望追求智能上限,并反对蒸馏,认为蒸馏只是复制 Claude 已有能力。行业字节跳动SeedQwen 3.8-Max推荐理由:字节要训超5万亿参数的模型,比阿里Qwen 3.8-Max和月之暗面K3都大,张一鸣表态反对蒸馏。原文稍后读已读值得跟进有用关注 字节跳动
01:31官方账号Cursor@cursor_aiCursor在官方博客发布了关于混合专家(MoE)模型的构建详解。文章具体介绍了专家路由、负载均衡等关键组件的实现思路。其目标是让更多实验室能够高效训练自己的MoE模型,降低AI研究门槛。技巧Cursor混合专家模型训练推荐理由:Cursor把自己做MoE模型的流程写成了博客,想自己训练混合专家模型的小团队可以直接照着搞。原文稍后读已读值得跟进有用关注 Cursor
02:08官方一手Meta Engineering Blog(博客/媒体)Meta的生成式广告推荐模型GEM支撑着Instagram和Facebook的广告推荐,现已在数千块最新GPU上训练。该训练将端到端效率翻倍,MFU达到20-25%。训练FLOPs同时扩展4倍,使广告推荐模型达到LLM规模。技巧GEMMeta广告推荐推荐理由:Meta把广告推荐模型训到LLM规模,效率翻倍,MFU到20-25%,算力扩4倍。值得做推荐训练的看看。原文稍后读已读值得跟进有用关注 GEM
15:58IT之家(博客/媒体)81°马斯克宣布SpaceX的工程数据将用于训练下一代Grok模型,模型规模约2万亿参数,是当前Grok 4.5(参数量约1万亿)的近两倍。受ITAR法规限制,梅林和猛禽发动机等敏感技术被排除,但Starlink硬件设计、制造工艺等数据纳入。该模型已进入最后训练阶段,预计本周完成。AI模型GrokSpaceXxAI2 个信源在谈事件专题推荐理由:马斯克要用SpaceX的火箭数据喂Grok,新模型2万亿参数比4.5翻倍,这波操作有点生猛。原文稍后读已读值得跟进有用关注 Grok
16:42shao__meng@shao__meng82°SpaceX收购了编程助手Cursor,实现模型训练的算力和数据打通。Grok 4.5之后的新模型将拥有2T参数,并在补充训练中引入SpaceX积累的世界级工程数据(不含ITAR限制)。Elon Musk称这将大幅提升Grok的工程能力,这一数据优势是OpenAI和Anthropic不具备的。AI模型GrokSpaceXCursor10 个信源在谈事件专题推荐理由:马斯克把SpaceX的工程数据喂给2T参数的Grok新模型,工程能力要起飞了,OpenAI和Anthropic可没这资源。原文稍后读已读值得跟进有用关注 Grok
00:03@koltregaskes@koltregaskesxAI的Grok 4.6(2T参数模型)将在下周完成初始训练。其性能可能超过Kimi K3。速度和成本与Grok 4.5相当。根据Elon Musk以往从训练完成到发布的时间,估计发布时间为9月中旬。AI模型Grok 4.62T模型Kimi K310 个信源在谈事件专题推荐理由:xAI的Grok 4.6下周完成训练,号称又快又便宜,还比Kimi K3强,预计9月中旬发布,可以关注。原文稍后读已读值得跟进有用关注 Grok 4.6
05:54Amjad Masad@amasad用户在X上分享在模型训练运行中获取实时进度更新的体验,称之为类似早期的vibe编码,但目标是构建个人模型。该推文获得了498次查看和1个点赞。实时监控使训练过程更直观,便于快速调整超参数。技巧模型训练实时监控vibe coding推荐理由:想实时监控你训练的模型进度?试试这个思路,像早期vibe编码一样,可以自己调参玩。原文稍后读已读值得跟进有用关注 模型训练
02:03Harrison Chase@hwchase17Harvey正在组建模型训练团队,计划从应用层扩展至模型层,并招聘各层级AI研究员,尤其关注有后训练开源或前沿模型经验者。该团队专注于大规模模型训练、合成数据生成、长 horizon 强化学习及真实部署评估。Harvey已通过后训练开源模型在代理任务中达到前沿性能,并计划在法务领域及更多垂直行业扩展。研究人员将获得数千块GPU和客户关系产生的独特训练数据。行业Harvey模型训练后训练推荐理由:Harvey在招人组建自己的模型训练团队,要把法律AI做到模型层,已有数千GPU和独特后训练数据,能提升开源模型到前沿水平,适合想做大型模型训练的AI研究员。原文稍后读已读值得跟进有用关注 Harvey
23:40官方账号Decoder@Maximilian Schreiner76°美团发布LongCat-2.0模型,参数量达1.6万亿,完全在国产芯片上训练完成,未使用Nvidia硬件。该模型在多个中文基准上表现优异,证明中国芯片可支撑超大规模AI训练。训练过程中采用分布式优化算法,效率接近国际主流方案。AI模型LongCat-2.0美团Nvidia7 个信源在谈事件专题推荐理由:美团搞了个1.6万亿参数的大模型LongCat-2.0,全程用国产芯片,没碰Nvidia,性能还很强。想看看中国芯片能不能撑起大模型?这篇聊得清楚。原文稍后读已读值得跟进有用关注 LongCat-2.0
05:49@koltregaskes@koltregaskes72°据x平台用户确认,Grok 2T运行已开始训练,计划七月完成,八月正式发布。此前有传言称下一代训练规模为3T,但该消息被指为猜测。马斯克作为xAI及特斯拉CEO,其公开预测需更加谨慎,以免影响投资者信心。AI模型GrokxAI模型训练推荐理由:x平台爆料Grok 2T开始训练,预计8月上线,比之前传的3T规模小一点。想蹲新模型的话可以关注这个时间点。原文稍后读已读值得跟进有用关注 Grok
13:51官方账号Jasper AI@heyjasperaiJasper将Hugging Face基础设施用于其MONET系统的数据创建和存储。该方法针对随时间更新的大型训练数据集进行了优化。Jasper团队通过HF实现了更高效的数据管道管理。这一案例展示了HF在训练数据工作流中的实际应用。技巧JasperHugging FaceMONET推荐理由:看看Jasper怎么用Hugging Face当MONET的数据后台,对做大模型训练数据管道的团队很有启发。原文稍后读已读值得跟进有用关注 Jasper
13:49官方账号Microsoft AI@MicrosoftAI微软AI在推文中介绍了构建编码模型的全流程,包括训练阶段的优化策略、评估方法、性能调优、安全性考量以及收集真实开发者反馈。文章深入展示了从模型设计到部署的每个环节,帮助理解如何让编码模型适配开发者的实际工作场景。AI模型微软AI编码模型模型训练推荐理由:微软AI分享了他们训练编码模型的实战细节,从评估到安全都有,做编程助手的人值得看看。原文稍后读已读值得跟进有用关注 微软AI
13:48岚叔@lufzzliz推文作者表达了对xAI下一代模型Grok 4.5的强烈期待。作者认为xAI可能拥有过多计算资源用于Grok 4.5的训练。希望Grok 4.5能训练得更出色并支持SpaceX。行业Grok 4.5xAISpaceX4 个信源在谈事件专题推荐理由:这位网友对Grok 4.5很有信心,还调侃xAI显卡太多不如自己用。看看民间对xAI新模型的态度。原文稍后读已读值得跟进有用关注 Grok 4.5
07:11官方账号OpenAI@OpenAIOpenAI通过少量训练数据使模型在53项独立评估中的44项上取得改进,涵盖欺骗、奖励黑客、安全、健康、心理健康等领域。该表现优于计算匹配的基线模型。评估涉及多种领域、任务格式和评分方案。论文OpenAI对齐AI安全10 个信源在谈事件专题推荐理由:OpenAI发现用一点额外数据就能让模型在超多对齐测试里变好,覆盖欺骗、安全、健康等方面,挺牛的。原文稍后读已读值得跟进有用关注 OpenAI
07:10官方账号OpenAI@OpenAIOpenAI在真实对话中训练模型,通过强化学习强化诚实、谦逊、开放纠正、公平和关怀人类福祉等特质。该训练覆盖健康、科学、教育等12个领域,旨在提升模型的对齐与安全性。方法基于RLHF改进,专注对话场景中的具体行为。AI模型OpenAI强化学习AI安全10 个信源在谈事件专题推荐理由:OpenAI训练模型时不止看能力,还用强化学习专门教它诚实、谦逊、愿意接受批评,覆盖12个领域,对AI安全性很有意义。原文稍后读已读值得跟进有用关注 OpenAI
09:34Fireworks AI@FireworksAI_HQKimi 2.7 现已完全在 Fireworks 上可训练,支持 SFT、DPO、RL 等训练方式。用户可以使用自己的数据微调模型,构建比前沿模型成本更低的护城河。Fireworks 提供托管点击或原始 API,支持大上下文和巨大 LoRA 秩。AI产品Kimi 2.7Fireworks微调推荐理由:Fireworks 让你拿 Kimi 2.7 自己训练,便宜还能干翻前沿模型,想定制模型的赶紧试试。原文稍后读已读值得跟进有用关注 Kimi 2.7
00:07官方账号Cursor@cursor_ai83°SpaceX以全股票交易收购Cursor AI,旨在构建全球最有用的AI模型。过去几个月,SpaceXAI与Cursor已联合训练一个模型。该模型将发布在Cursor和Grok Build中。合作将推动Cursor能力显著提升。行业SpaceXCursor收购10 个信源在谈事件专题推荐理由:SpaceX收购了Cursor,以后编程时能用上SpaceX训练的模型,效率可能会大幅提升。原文稍后读已读值得跟进有用关注 SpaceX
23:31IT之家(博客/媒体)71°开发者@0x0SojalSec 绕过苹果M4神经网络引擎的软件限制,通过逆向工程使用自定义MIL(模型中间语言)直接与芯片通信,没有调用Core ML、Metal或GPU。训练数据全程放在RAM中运行,不写入NAND闪存,速度更快。解锁后M4在iPad或Mac上可达到15.8TFLOPS的AI处理性能,用于训练模型。目前自定义MIL能否用于更新的Apple Silicon尚不明确。技巧M4Apple Silicon神经网络引擎推荐理由:有个开发者自己写了一套代码,把M4芯片的AI训练能力全开出来了,不用苹果官方工具,跑到了15.8TFLOPS。想用iPad或Mac训练模型的人可以看看。原文稍后读已读值得跟进有用关注 M4
13:34官方账号Thinking Machines Lab@thinkymachines83°Think Machines 宣布与 NVIDIA 合作,利用其硬件和平台来训练前沿模型,并提供可定制的 AI 解决方案。这一合作将加速模型训练效率,降低开发门槛,使企业能够更灵活地部署定制化 AI。NVIDIA 的算力支持将帮助 Think Machines 在竞争激烈的 AI 市场中提升模型性能。行业NVIDIAThink Machines模型训练10 个信源在谈事件专题推荐理由:NVIDIA 与 Think Machines 的合作意味着更强大的算力支持,做模型训练和定制 AI 的团队可以关注这一进展,看看能否利用其平台加速自己的项目。原文稍后读已读值得跟进有用关注 NVIDIA