7月23日
11:22
11:22官方账号arXiv cs.AI@Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun Moon
ELSAA提出一种结合稀疏和低秩分支的注意力近似方法,避免显式计算完整的N×N注意力矩阵。稀疏分支捕捉高相似度交互,低秩分支压缩全局信息,并通过分母感知融合项平衡两者。该方法旨在支持更长上下文训练,同时保留token级交互和上下文混合能力。在多个长序列基准上验证了其效率与效果。
推荐理由:这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。
7月21日
09:56
09:56官方账号arXiv cs.LG@Rong Fu, Yongtai Liu, Xiaowen Ma, Haoyu Zhao, Shuo Yin, Yiqing Lyu, Long Zhang, Wangyu Wu
精选
DynImmune-BERT是一种连续时间免疫组库模型,用于患者免疫状态预测。该模型结合了深度自适应中心对数比初始化、克隆存在门控神经ODE动态和边界邻域自注意力。它通过低秩元适配器初始化复发克隆型,参数数量独立于观察到的克隆数。在纵向T细胞受体库数据集上的评估显示,事件感知的时间建模能增强静态编码器性能,但小规模外部队列需谨慎解读。
推荐理由:你要是做免疫组库时间序列分析,这个模型把神经ODE和Transformer揉在一起,能处理克隆动态和复发,比静态模型强。
7月17日
10:00
09:50
7月16日
00:55
00:55官方账号Microsoft Research@MSFTResearch
微软CVP Doug Burger与研究员Subutai Ahmad、Nicolò Fusi讨论人类记忆与机器智能的根本差异。他们指出人类在分心数小时后难以记住新密码,而Transformer模型能轻松完成。该讨论对比了神经科学与人工智能的核心区别。
推荐理由:微软大佬们聊了个有趣的话题:为啥你记个密码这么费劲,Transformer却轻轻松松,值得一看
7月15日
10:05
7月14日
12:00
12:00官方账号arXiv cs.LG@Michael Rizvi-Martel, Satwik Bhattamishra, Guillaume Rabusseau, Michael Hahn
这篇论文聚焦Transformer的理论理解,指出已有研究大多分析其表达性,但很少涉及可学习性。受损失景观分析启发,作者初步提出了学习C-RASP构造的样本复杂度边界。该工作为理解Transformer在有限样本下的学习能力提供了理论基础。
推荐理由:这篇论文讲了Transformer的理论短板——表达性研究够了,但学不学得会还不知道。他们用C-RASP给出了样本复杂度的初步界限,对想深挖模型理论的人很有用。
7月9日
7月3日
12:04
7月2日
12:35
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。
推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。
7月1日
16:57
10:32
10:32官方账号arXiv cs.AI@Srijan Tiwari, Aditya Chauhan, Manjot Singh
该论文对神经网络在算法任务上的延迟泛化(grokking)现象进行几何分析,发现交叉熵优化下隐藏表示的径向膨胀是延迟的主因。作者提出径向-角分解并推导三个可检验命题,引入单一超参数范数惩罚将激活约束在 sqrt(d) 半径超球面上。在模算术任务上,该惩罚使 MLPs 和 Transformers 的 grokking 加速高达 6 倍;对 10M 参数的 nanoGPT 在 3 位数加法上训练步数减半。
推荐理由:这篇论文用几何视角解释了神经网络为什么先死记硬背后突然泛化,还找到了一个简单技巧(约束隐藏层半径)让 grokking 快 6 倍,值得搞训练的人看看。
10:08
10:08官方账号arXiv cs.AI@Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu
论文提出一种操作级视觉令牌跳过框架,将Transformer层分解为注意力与FFN操作,选择性跳过冗余计算。实验覆盖3种MLLM架构(含Qwen3-VL)和10个VQA基准,实现精度-效率权衡:在Qwen3-VL上减少33.7% TFLOPs,保留99.5%的原始性能。关键发现是晚期视觉令牌更新对答案表示影响很小,且有效计算具有操作主导性和层依赖性。
推荐理由:这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。
6月30日
14:30
14:30AI Will@FinanceYF5
Christopher Manning(GloVe词向量、Transformer注意力机制联合发明人)将于Stanford HAI发表演讲。他曾获2024年IEEE John von Neumann Medal。演讲主题聚焦世界模型,探讨语言模型遇上具身智能。他是Stanford NLP Group创始人及CS224N课程创建者。

推荐理由:GloVe和Transformer的创造者Manning要讲语言模型怎么和机器人结合了,想了解具身智能世界模型的可以听听。
6月24日
6月23日