8月7日
01:00
01:00AK@_akhaliq
论文《Towards Physics of Multimodal Pretraining》已在Hugging Face发布,编号2608.05。论文围绕知识流、模态协同、早期统一三个核心议题展开。作者针对这些议题给出了具体的预训练配方。

推荐理由:这篇论文把多模态预训练拆成知识流、模态协同和早期统一,还给了训练配方,搞多模态的可以读读。
8月6日
10:11
10:11官方账号arXiv cs.LG@Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis
该论文通过合成和真实数据上的受控实验,揭示了多模态预训练中语言、视觉理解与视觉生成之间的非对称知识流。研究发现数据复杂度决定模态协同,共享注意力与归一化能促进协同,而早期联合训练优于晚期对齐。实验还发现“视觉懒惰”现象,即延迟融合会导致模型依赖语言先验。作者提出的高效配方仅用5%计算预算即可达到强生成性能,并训练了13.5B MoE模型在2T tokens上验证结论。
推荐理由:这篇论文把多模态预训练的内部机制拆开了,告诉你模态之间怎么互相影响、什么时候协同、什么时候拖后腿,还有省算力的训练配方,值得看看。