01:36官方账号Clement Delangue@ClementDelangue精选Hugging Face 宣布其存储平台已成为私有和公开模型及数据集的最佳选择,支持中间和最终版本。以 @heyjasperai 为例,他们使用 HF 存储桶存储 Monet 数据集并直接在其上训练模型。这展示了 HF 在 AI 存储和训练工作流中的一体化能力。对于需要管理大型模型和数据集的团队,HF 提供了便捷的存储和训练集成方案。AI产品Hugging Face存储平台数据集推荐理由:Hugging Face 将存储与训练无缝集成,管理模型和数据集的团队可以直接在平台上完成从存储到训练的全流程,省去多平台切换的麻烦。原文稍后读已读值得跟进有用关注 Hugging Face
12:27rohanpaul_ai@rohanpaul_ai来自斯坦福、MIT、哈佛和 Anthropic 的联合研究揭示了大型语言模型能学会小模型无法掌握的技能的根本原因:大模型在训练过程中更不容易遗忘稀有技能。其额外容量能保护弱学习信号,而小模型的有限神经元会被常见任务占据,导致稀有任务在学习信号出现足够多次之前就被覆盖。研究通过控制实验和 OLMo 模型(4M 到 4B 参数)验证了这一结论,发现大模型在低频任务上表现更好,能保留更多任务特征,且梯度干扰更小。该论文为模型规模与能力涌现之间的关系提供了清晰的训练层面解释。论文大模型模型训练涌现能力5 个信源在谈事件专题推荐理由:做模型训练或理解 scaling law 的团队值得一读——这篇论文把大模型涌现能力的机制讲清楚了,不是玄学而是容量与干扰的数学问题。原文稍后读已读值得跟进有用关注 大模型
19:45官方账号Decoder@Matthias Bastian72°据报道,马斯克的 xAI 使用 Anthropic 的 Claude 模型输出来训练自己的编程模型,持续了数月。在 Anthropic 切断访问后,xAI 仍通过私人账户和 Blackbox AI 服务继续使用。与此同时,xAI 的预训练团队缩减至不到五人,多名负责人离职。马斯克购买的算力现在被租给 Anthropic 和 Google,而非用于自己的模型训练。这一事件揭示了 AI 行业在模型训练数据使用上的灰色地带和竞争紧张关系。行业xAIClaude模型训练10 个信源在谈事件专题推荐理由:这件事暴露了 AI 大模型训练中数据来源的灰色操作,做模型训练的团队和关注 AI 伦理的读者值得一看——它直接关系到训练数据的合规性和行业竞争规则。原文稍后读已读值得跟进有用关注 xAI
10:45IT之家(博客/媒体)精选76°深圳河套学院联合哈工大、华为等团队,依托华为昇腾910C国产AI算力集群,成功完成1.6万亿参数大模型DeepSeek-V4-Pro的全参数后训练。这是全球第三方机构首次在国产算力平台上完成如此规模的模型训练,模型算力利用率超过30%,关键训练算子效率提升14%,达到工业级运行标准。该成果证明国产AI芯片已能支撑世界级超大参数模型训练,为国产算力生态积累了重要经验。AI模型华为昇腾910C国产算力万亿参数大模型推荐理由:国产芯片终于能跑万亿参数大模型了,做AI基础设施和模型训练的团队值得关注——这证明昇腾910C已具备工业级训练能力,后续国产替代路径更清晰。原文稍后读已读值得跟进有用关注 华为昇腾910C
16:51向阳乔木@vista8Laten Space 访谈了 Ethan He,分享了一系列关于 AI 模型训练与交互的深刻观点。他指出模型进步速度取决于团队迭代速度,质量提升更多来自修数据和训练流程中的 bug 而非新算法。视频模型训练需要极其详细的文本标注,GPT Image 生成图片时大部分时间在思考重写提示词。他还认为扩散模型将成为人机交互的前端层,在脑机接口普及前,最自然的交互方式是用户说话、AI 用生成式画面回应。行业模型训练迭代速度GPT Image推荐理由:Ethan He 把模型训练和交互设计的底层逻辑讲透了,做模型训练或产品设计的开发者看完会有启发,特别是关于迭代速度和交互未来的观点值得反复琢磨。原文稍后读已读值得跟进有用关注 模型训练
17:15IT之家(博客/媒体)72°北京大学数学科学学院2007级校友、宾夕法尼亚大学沃顿商学院副教授苏炜杰在社交平台宣布正式加入OpenAI,目前处于沃顿休学期间,将参与AI模型训练。苏炜杰是统计学界最高荣誉COPSS会长奖(被誉为“统计学诺奖”)的2026年得主,也是14年来首位获此奖项的华人学者。他的研究方向涵盖机器学习、差分隐私数据保护和高维统计,其差分隐私工作已成功应用于2020年美国人口普查。今年以来,已有陈立杰、庞若鸣、张鹏川等多位华裔顶尖AI学者加盟OpenAI。行业OpenAI苏炜杰统计学诺奖10 个信源在谈事件专题推荐理由:苏炜杰是统计学界顶级奖项得主,他的加入意味着OpenAI在模型训练和隐私保护方向持续加码,做AI基础研究和数据安全的从业者值得关注这位新成员的动向。原文稍后读已读值得跟进有用关注 OpenAI
16:11Fireworks AI@FireworksAI_HQ76°Cursor 团队没有通过提示工程优化 Composer 2.5,而是直接训练了模型。他们与 Fireworks 合作,在 Fireworks 上运行大规模强化学习(RL)滚动,同时进行生产推理。Fireworks 强调,到 2027 年,训练自己的模型是维持竞争护城河的唯一方式。这一做法展示了从提示工程到模型训练的转变趋势。AI产品CursorComposer 2.5强化学习10 个信源在谈事件专题推荐理由:Cursor 用 RL 训练模型而非提示工程,给 AI 产品团队一个关键信号:2027 年后,训练自己的模型才是护城河。做 AI 应用开发的建议点开,看看他们怎么和 Fireworks 合作跑 RL 滚动。原文稍后读已读值得跟进有用关注 Cursor
00:38TestingCatalog@testingcatalog78°SPACEXAI 宣布基于 1.5T V9 基础模型的新版 Grok 已完成训练,预计今年夏季推出重大升级。团队还计划在补充训练中加入 Cursor 数据,进一步提升模型性能。这一进展意味着 Grok 将在对话、推理等能力上迎来显著提升,值得关注。AI模型GrokSPACEXAI1.5T V94 个信源在谈事件专题推荐理由:Grok 的 1.5T 参数模型完成训练,AI 对话和推理能力将迎来飞跃,关注大模型进展的开发者可以提前关注今夏的发布。原文稍后读已读值得跟进有用关注 Grok
01:10官方账号AlphaSignal@AlphaSignalAI70°Hugging Face 开源了一个 CLI 智能体,能自动执行机器学习工程师的完整研究循环:从阅读论文、追踪引用,到拉取数据集、编写训练脚本,再到启动 GPU 任务并迭代优化。在科学推理任务中,它训练 Qwen3-1.7B 将 GPQA 得分从 10% 提升至 32%,超越 Claude Code 的 22.99%。在医疗领域,它因公开数据集质量不足,自动生成 1100 个合成样本并上采样 50 倍,在 HealthBench 上比 Codex 高出 60%。该智能体还具备自主诊断失败评估、恢复训练的能力,以 CLI 和 Web 应用形式提供,甚至可在手机上运行。AI产品Hugging FaceCLI 智能体开源/仓库推荐理由:Hugging Face 这个开源智能体把 ML 研究全流程自动化了,做实验的团队可以直接用它跑论文复现和模型训练,省掉大量手动调参和写脚本的时间。原文稍后读已读值得跟进有用关注 Hugging Face
00:33官方一手Google Developers Blog(博客/媒体)Google在Orbax和MaxText中引入了持续检查点功能,旨在平衡模型训练的可靠性与性能。传统固定频率检查点要么牺牲可靠性,要么成为性能瓶颈。持续检查点通过异步方式,仅在上一次保存成功后启动新保存操作,最大化I/O带宽并降低故障风险。基准测试显示,该方法显著减少检查点间隔,在大规模训练中(平均故障间隔短)能大幅节约资源。AI模型模型训练可靠性检查点推荐理由:对于大规模训练任务,持续检查点能有效提升资源利用率和系统稳定性,是应对硬件故障、优化训练吞吐量的实用方案。原文稍后读已读值得跟进有用关注 模型训练
21:55官方账号Together AI@togethercomputeTogether AI在X平台发布了一款新的开源工具包,旨在简化AI模型的训练和部署流程。该工具包支持多种主流模型架构,并提供了优化后的分布式训练功能。这一发布有助于降低中小团队使用大模型的门槛,推动AI技术的普及。AI产品开源/仓库模型训练Together AI推荐理由:对于AI开发者和研究团队,该工具包提供了实用功能,可提升模型开发效率,值得关注其后续更新。原文稍后读已读值得跟进有用关注 开源/仓库