9月1日
09:20
09:20官方账号arXiv cs.LG@Yuqi Pan, Zheng Li, Bohao Tang, Zhen Qin, Guoqi Li
精选73°
LoGo是一种新型注意力机制,解决了长上下文场景下的计算瓶颈问题。该模型通过动态分配注意力预算,为每个token选择局部或全局注意力。实验显示,LoGo在保持全注意力Transformer扩展性的同时,在长距离检索任务上表现优于静态混合模型。
推荐理由:LoGo让模型智能决定哪些token需要全局注意力,大幅提升长文本处理效率,比传统Transformer更聪明。
8月29日
00:39
00:39官方账号arXiv cs.LG@Thorsten Tegetmeyer-Kleine, Thomas Schmitt, Phillip Aquino, Christiane Rahe, Dirk Uwe Sauer, Weihan Li
精选73°
研究人员使用冻结的自监督视觉Transformer编码器,结合轻量级可训练解码器和迭代模型辅助标注,将稀疏标注预算转化为大规模退化测量。该方法应用于三张120兆像素NMC阴极横截面图像,能够区分颗粒内裂纹和早期/晚期颗粒间裂纹。循环老化样品的晚期颗粒间裂纹覆盖率达到4.6%,而初始和日历老化样品仅为0.5%。
推荐理由:斯坦福团队用基础模型解决电池老化检测难题,一张图像就能获取全颗粒统计,比人工标注快数百倍。
8月25日
11:28
11:28官方一手arXiv: Google DeepMind@Joshua Nunley
TANGO模型通过跨token门控残差更新替代了传统的Transformer块,在FineWeb-Edu、Lean和DeepMind Mathematics等基准测试中表现出色,与WANGO模型相比,在序列长度线性复杂度下计算效率更高。TANGO和WANGO均优于Recurrent和Untied Transformer++、full-attention GAU和FLASH模型。
推荐理由:TANGO模型在自然和形式语言建模中表现出色,计算效率高,值得关注。与WANGO相比,在序列长度线性复杂度下表现更优。
11:02
11:02官方账号arXiv cs.LG@Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge
Next-Scale Transformer模型在人脸多视角合成方面取得进展,通过高分辨率、多视角输出和跨视角一致性,实现更真实的人脸视图合成。模型在合成数据集上训练,无需2D预训练,使用通用预训练,最终生成清晰、逼真的3D人脸模型。
推荐理由:Next-Scale Transformer模型在人脸合成方面表现出色,与现有模型结合,生成更精确的3D人脸模型,值得关注。
8月24日
09:53
09:53官方账号arXiv cs.LG@Mieszko Komisarczyk, Saurabh Mathur, Maurice Kraus, Sriraam Natarajan, Kristian Kersting
Tydra,一种混合Transformer-State Space Model架构,在30个OpenML数据集上,相较于TabPFN减少30%的推理时间,同时保持大部分预测性能,优于Hydra模型,表明混合架构是表格基础模型的有前景方向。
推荐理由:Tydra模型在保持预测性能的同时大幅降低推理时间,比Hydra模型更高效。
8月22日
08:34
8月18日
8月17日
10:27
10:27官方账号arXiv cs.AI@Pin-Yen Huang, Sachin Chhabra, Prasanth Sai Gouripeddi, Abhinav Kumar, Baoxin Li
RecipeNet是一种层级Transformer架构,用于编码配方数据中步骤内的字段交互和步骤间的顺序依赖。实验在多个配方数据集和任务上进行,结果显示RecipeNet持续优于现有表格模型,证明了层级与顺序建模对配方表示学习的价值。该研究来自arXiv论文2608.14505v1。
推荐理由:论文提出了RecipeNet,专门处理材料合成、制药配方这类结构化步骤数据,比通用表格模型更能捕捉层级和顺序信息。
8月15日
10:11
8月7日
8月6日
06:48
06:48官方账号Cohere@cohere
Cohere 官方账号发布视频,配文称“学生 Transformer 已变成大师”,并引用了 Aidan Gomez 的推文。Aidan Gomez 在推文中写道“Time to bring back Google Brain”。这条互动推文在 X 平台获得 22 个点赞、2529 次浏览。
推荐理由:Cohere 拿学生 Transformer 玩梗,Aidan Gomez 接话说要复活 Google Brain,这俩人到底在暗示啥,点开视频不就知道了。
8月5日
8月4日
8月3日
7月31日
12:37
12:37官方账号arXiv cs.LG@Jonathan J. Heckman, Shani Meynet, Alessandro Mininno, Gary Shiu
该论文用机器学习判定超对称quiver规范理论中的Seiberg对偶,数学上等价于判断quiver的突变。在约10个节点的quiver上,Transformer和多层感知机架构的表现优于确定性算法。加入pathfinder算法(作者称之为“quiver版Google Maps”)后,搜索效率和准确率进一步提升。论文认为这类问题可作为前沿AI模型用于理论物理的基准测试。
推荐理由:这篇论文用AI判断两个物理系统是否对偶,在约10节点quiver上比传统算法快,还配了“quiver版谷歌地图”提高准度。
7月27日
12:13
12:13官方账号arXiv cs.AI@Alex Koziell-Pipe, Jasmine Brewer, Jem Guhit, Marwa H. Farag, Kripa Panchagnula, Gabriel Laude, Fabian Finger, Carlo Gaggioli, Ludmila Szulakowska, Oliver J. Backhouse, Christos Papalitsas, Jason G. Mustakis, Thomas Soini, David Munoz Ramo, Stephen Clark, Elica Kyoseva, Enrico Rinaldi
ADAPT-GQE是一个生成式AI框架,利用ADAPT-VQE生成的参考电路训练模型,再通过强化学习提升电路生成精度。在抗抑郁药分子imipramine上测试,电路生成时间比ADAPT-VQE减少一个数量级,准确度相当或更优。生成的电路已在Quantinuum Helios-1量子硬件上成功执行,这是AI生成量子化学电路在先进量子硬件上的里程碑。
推荐理由:这个框架能自动设计量子化学电路,比传统ADAPT-VQE快10倍,还在真实量子计算机上跑了实验。搞量子计算化学的可以看看。
11:58
11:58官方账号arXiv cs.AI@Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet Le
PRIMS是一种物理感知的多模态Transformer,通过三个模块将物理知识融入表示学习和注意力机制。在五流体基准上,PRIMS达到98.92%平均F1分数,参数量仅0.46M,比最先进Transformer方法缩小14倍。在未见过的温度范围和流速范围分布外偏移下,PRIMS持续优于现有最佳模型,展现出对未训练工况的强鲁棒性。
推荐理由:PRIMS把物理规则直接写进模型结构,用0.46M参数在5种流体识别上拿到98.92% F1,比大模型小14倍还更抗干扰,适合微流控场景。
7月23日
13:07
13:07Stanford AI Lab@StanfordAILab
斯坦福团队提出一种无需梯度下降即可将事实知识写入Transformer MLP的封闭形式方法。该方法可直接将事实编码进Transformer块,无需训练。相关论文已被COLM 2026接收。研究者包括Jerry Liu、Garctrob、Ronny Junkins等。
推荐理由:斯坦福团队搞了个新招:不用梯度下降,直接把事实写进Transformer的MLP里,论文被COLM 2026收了,想了解怎么不训练就灌知识的可以看看。