7月13日
20:43
6月12日
13:22
13:22官方账号Z.ai (智谱国际)@Zai_org
智谱AI宣布将GLM-5.1和GLM-5-Turbo的“三倍用量”优惠期延长至6月30日。用户可在除美国东部时间凌晨2-6点外的任意时段使用。这一调整让开发者有更多时间以更低成本体验高性能模型,适合需要大模型推理和生成能力的团队。
事件专题

推荐理由:智谱延长三倍用量优惠,做AI应用开发的团队可以趁此机会低成本测试GLM-5系列模型,建议有需求的开发者抓紧使用。
6月10日
09:27
09:27官方账号Simon Willison@simonw
83°
Simon Willison 分享了对 Claude Fable 5 的初步印象,称其具有“大模型气味”:运行缓慢、价格昂贵,但几乎能处理他抛出的所有任务。该模型在复杂推理和多步骤任务上表现出色,但高昂的成本和延迟可能限制其普及。Willison 认为,对于需要极致能力的专业用户来说,Fable 5 是值得的,但对普通开发者而言,性价比仍是问题。
事件专题

推荐理由:Claude Fable 5 的“大模型气味”揭示了当前顶尖模型的取舍——慢、贵但能力惊人。做复杂推理或高难度任务的开发者,值得看看 Willison 的实测感受,判断它是否值得你的预算。
6月9日
6月8日
6月7日
13:14
13:14IT之家博客/媒体
2026年高考语文科目结束,小米集团总裁卢伟冰在微博上晒出由小米Mimo大模型撰写的北京卷作文《做规划与下功夫》。作文以程端礼的《读书分年日程》为引,探讨规划与努力的关系,并引用钱学森、王羲之等案例。卢伟冰还自曝自己高考语文考得不太好。此举展示了AI在写作领域的应用能力,引发对AI参与高考作文的讨论。

推荐理由:小米高管亲自用自家大模型写高考作文,既展示了Mimo的写作能力,又蹭了高考热点。对AI写作感兴趣的读者可以看看大模型如何理解并完成命题作文,顺便感受一下卢伟冰的幽默自嘲。
6月4日
6月3日
6月2日
12:06
12:06官方一手arXiv: DeepSeek@Boao Kong, Weichen Jia, Engao Zhang, Guohong Li, Yonghan Dong, Yao Wang, Yaoyuan Wang, Yunke Peng, Kun Yuan
低精度训练在降低大模型训练成本的同时,常因少数算子的数值不稳定导致训练失败。论文提出GNMR(梯度范数与均值比)轻量控制器,通过比较当前梯度范数与历史均值,并结合Δ-GNMR检测短窗口内的突变,在固定预算和锁定间隔内执行恢复操作,无需改变数值格式或底层实现。在激活量化、DeepSeek式训练和LLaMA-2 13B微调等场景中,GNMR以稀疏的恢复动作保持高保真质量。该方法为低精度训练提供了一种后端无关的稳定性控制方案。
推荐理由:低精度训练是降低大模型成本的关键,但数值不稳定常让训练白费。GNMR用轻量控制解决了这个痛点,做大规模训练或量化训练的团队值得关注,可以直接集成到现有流程中。
5月30日
5月27日
11:12
11:12官方一手歸藏(guizang.ai)@op7418
MiniMax 宣布即将发布新一代 M3 模型,并开源其 MSA 架构。这是 MiniMax 沉寂一段时间后的重要更新,M3 模型预计在性能上有显著提升。开源 MSA 架构将推动社区研究和应用发展。该消息在推特上引发关注,但具体细节尚未公布。
推荐理由:MiniMax 的 M3 模型和开源 MSA 架构值得关注,尤其是对开源大模型和架构研究感兴趣的开发者,可以提前了解并准备试用。
5月25日
5月24日