FineWeb-Edu
general · 首次出现 2026-05-22 · 最近出现 2026-08-25 · 累计提及 13
综述
相关报道
6 条在档- TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language ModelingarXiv: Google DeepMind
- 跨模型KV缓存迁移:线性映射实现预填充复用arXiv cs.LG
- 角色解耦注意力残差:按深度分离匹配与内容检索arXiv cs.AI
- CO-LMLM:基于连续查询的有限记忆语言模型arXiv cs.LG
- NVIDIA 发布 Gated DeltaNet-2:线性注意力层解耦擦除与写入marktechpost
- Gated DeltaNet-2:解耦线性注意力中的擦除与写入门控arXiv cs.AI