8月14日
12:05
12:05官方账号arXiv cs.AI@Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech
DFM Mimir v1是丹麦基础模型团队发布的10亿参数语言模型,基于HRM架构从零训练。该模型仅使用许可的后训练数据,混合了161个数据集进行训练。在20个英语、数学与代码及丹麦语基准上,Mimir v1超过HRM-Text 1B,并可与Qwen 3.5 4B和Gemma 4 E2B竞争。它在丹麦语任务上刷新了最先进水平,模型现已在Hugging Face Hub开放下载。
事件专题

推荐理由:丹麦团队开源了10亿参数的Mimir v1,只用合规数据就追上4B模型,丹麦语还是第一。
6月30日
01:17
01:17官方账号Simon Willison’s Weblog博客/媒体
精选
DeepReinforce 发布 Ornith-1.0,一款 MIT 许可的开源模型,基于 Gemma 4 和 Qwen 3.5 预训练。提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种规格。在编码基准上达到同尺寸开源模型 SOTA。作者在 LM Studio 上测试 35B Q4_K_M GGUF 版本,能流畅运行代理工具调用并处理代码定位任务。
事件专题

推荐理由:DeepReinforce 新出的开源编码模型,基于 Gemma 4 和 Qwen 3.5,在代理编码任务上表现不错,LM Studio 就能跑,值得试试。
6月16日
20:28
20:28官方账号Tri Dao (FlashAttention)@tri_dao
精选
在运行大规模上下文智能体时,Qwen 3.5和Nemotron Ultra等混合模型面临Gated-DeltaNet/Mamba状态的瓶颈。一个简单洞察是加载状态并计算但不存储,可使速度提升2倍。该重计算技巧最终解锁了状态空间模型(SSM)的推测解码(spec decoding)功能。
事件专题

推荐理由:不用存状态,算完就扔,SSM推理直接快一倍,Qwen 3.5和Nemotron Ultra用户试试这个技巧。