09:35官方账号arXiv cs.AI@Nikos Giakoumoglou, Andreas Floros, Kleanthis-Marios Papadopoulos, Tania Stathaki精选73°ViTAMINS方法将合成难例整合到无监督视觉Transformer预训练中,提升表示质量。在ImageNet和迁移学习、图像检索、拷贝检测、图像视频分割任务上全面基准测试。ViTAMINS的难例带来涌现特性,学习到的表示包含图像语义内容信息,作为分类器表现优异,比基线提升最高11.3%。ViTAMINS通过简单修改现有对比框架实现,资源效率更高,ViT-B版本超越V-JEPA的ViT-L版本。论文ViTAMINSVision Transformers自监督学习推荐理由:ViTAMINS用合成难例提升视觉Transformer性能,资源效率还更高,ViT-B就能打败V-JEPA的ViT-L。原文稍后读已读值得跟进有用关注 ViTAMINS
11:13官方账号arXiv cs.LG@Kaustubh Kapil, Kishor P. Upla研究者提出Transformer Geometry Observatory (TGO) 系统框架,用于探索视觉Transformer的表征几何与动力学。TGO-I聚焦光谱几何,使用ViT-Small/16模型在ImageNet-100上训练,分析有效秩、稳定秩、参与比、光谱熵、光谱平坦度、光谱各向异性等指标。结果发现训练中维度利用率持续增加,各向异性降低,光谱熵和参与比上升,特征谱趋于平坦。与直觉相反,方差在表征维度上再分配,CLS token表征展现出最高有效维度和最低各向异性。论文Vision TransformersViT表征几何推荐理由:这篇论文用TGO框架搞清楚了ViT的维度在训练中怎么变化——不是集中而是越来越分散,尤其CLS token最明显,对理解视觉Transformer内部机制很有参考价值。原文稍后读已读值得跟进有用关注 Vision Transformers