12:07官方账号arXiv cs.LG@Sandro Kuppel, Julian Hoßbach, Samuel Tovey, Christian Holm该论文提出一种多模态深度学习架构,联合处理原始时间序列、小波图像和静态特征向量,在42肽基准上超越现有方法超过10个百分点。模型在20氨基酸数据集上实现了接近完美的准确率。注意力分析显示时间序列和小波图像输入关注同一事件的不同特征。研究展示了机器学习在纳米孔传感器中实现高精度分子识别的潜力。论文nanoporeTransformer多模态推荐理由:他们用多模态Transformer把纳米孔信号分类精度提升了10个百分点,42肽和20氨基酸两个数据集都表现优异,值得关注。原文稍后读已读值得跟进有用关注 nanopore
11:22官方账号arXiv cs.AI@Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun MoonELSAA提出一种结合稀疏和低秩分支的注意力近似方法,避免显式计算完整的N×N注意力矩阵。稀疏分支捕捉高相似度交互,低秩分支压缩全局信息,并通过分母感知融合项平衡两者。该方法旨在支持更长上下文训练,同时保留token级交互和上下文混合能力。在多个长序列基准上验证了其效率与效果。论文ELSAATransformer注意力机制推荐理由:这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。原文稍后读已读值得跟进有用关注 ELSAA
09:56官方账号arXiv cs.LG@Rong Fu, Yongtai Liu, Xiaowen Ma, Haoyu Zhao, Shuo Yin, Yiqing Lyu, Long Zhang, Wangyu Wu精选DynImmune-BERT是一种连续时间免疫组库模型,用于患者免疫状态预测。该模型结合了深度自适应中心对数比初始化、克隆存在门控神经ODE动态和边界邻域自注意力。它通过低秩元适配器初始化复发克隆型,参数数量独立于观察到的克隆数。在纵向T细胞受体库数据集上的评估显示,事件感知的时间建模能增强静态编码器性能,但小规模外部队列需谨慎解读。AI模型DynImmune-BERT免疫组库神经ODE推荐理由:你要是做免疫组库时间序列分析,这个模型把神经ODE和Transformer揉在一起,能处理克隆动态和复发,比静态模型强。原文稍后读已读值得跟进有用关注 DynImmune-BERT
09:50官方账号arXiv cs.LG@Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen论文在整数算术任务上发现,vanilla Transformer模型可通过人类有效学习方法提升性能。通过将算术任务分解为子任务并做损失收敛顺序分析,揭示LLM学习模式与人类相似,简单子任务学习更快。应用人类问题解决策略和认知赋能方法后,准确率显著提高。研究通过准确率提升实验、可视化验证和解释性分析展示了方法有效性。工作探索了Transformer LLM与人类学习者的潜在相似性,并用可解释AI验证增强信任。论文TransformerLLM算术任务推荐理由:这篇论文发现Transformer学算术的方式跟人很像,用教人算术的策略来调模型,效果还真不错,想了解LLM推理机制和可解释性的话值得一看。原文稍后读已读值得跟进有用关注 Transformer
01:10elvis@omarsar0精选研究提出RLM harness作为组合泛化器,使Transformer无需额外泛化能力即可迁移任务。训练RLM时,短任务(如8倍长度)与长任务产生相同轨迹,模型可泛化至8-32倍长度未见任务。跨领域任务(如数学解法与论文写作)共享分解策略时也表现出相同泛化效果。该发现基于2026年论文,通过设计良好的harness形成商集,使LLM调用将结构相似任务视为相同。论文RLMHarnessTransformer推荐理由:这篇研究很酷,RLM harness让Transformer在短任务上训练就能自动泛化到长任务,甚至跨领域。不用改模型结构,靠框架就能实现。原文稍后读已读值得跟进有用关注 RLM
10:00官方账号arXiv cs.AI@Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev AroraT2MLR是一种基于Transformer的潜在推理架构,将前一token的中间层表示缓存并注入当前token的早期层,使抽象中间计算能跨解码步骤持续。在自然语言预训练和多跳推理微调中,T2MLR始终优于同等数据和参数的Transformer基线。仅对20%的网络应用中层循环就能超过全层循环。改装1.7B预训练Transformer并微调后,数学推理性能显著提升。AI模型T2MLRTransformer推理模型推荐理由:一种新的Transformer改进:只改中间20%的层加个循环机制,就能让模型推理更持久,而且可以直接改装现有模型不用从头训。原文稍后读已读值得跟进有用关注 T2MLR
09:50官方账号arXiv cs.AI@Jiajun Hu, Ruthwik Reddy Sunketa, Lei Zhao, Archit Gajjar, Luca Buonanno, Aman Arora精选NIFA是一种新型FPGA架构,通过集成无ADC的IMC块(用ACAM替代传统ADC)来原生处理非线性运算,从而提升Transformer模型的推理效率。相比传统FPGA,NIFA在CNN基准上实现高达40倍能效提升和4.1倍面积效率提升,在Transformer基准上实现1.9倍能效和2.5倍面积效率提升。该架构针对注意机制中的动态矩阵乘法(DIMM)进行了优化,能有效处理长输入序列。论文NIFAFPGA推理效率推荐理由:这篇论文提出NIFA架构,用ACAM替代ADC省掉70%面积和功耗,让FPGA跑Transformer能效提升近2倍,CNN更是飙升40倍。原文稍后读已读值得跟进有用关注 NIFA
11:08官方账号arXiv cs.LG@Yiming Ma, Xinyu ChenVAIOM 是一种 decoder-only Transformer,专门用于对一小时的汇率柱进行概率性下一回报建模。它采用连续多元金融事件向量作为输入,同时将输出建模为波动率归一化后收益桶上的类别分布。在 0.9M 混合连续输入模型上,结合了连续事件特征和分类资产元数据,以及混合市场状态回报头、间隙、波动率制度和序数辅助目标,并通过全序列监督进行训练。在 2025 年的两个测试周期中,VAIOM 在所有训练种子上均优于固定单柱 LightGBM 基线,标准检查点的增益分别为每个事件 0.029 和 0.043 比特。对比实验表明,连续输入优于离散令牌输入,全序列监督优于最后一个位置训练,且辅助表征塑造和混合结构回报头改善了回报似然。论文VAIOM金融建模时间序列推荐理由:VAIOM 是专门处理金融连续数据的解码器模型,在汇率数据上比 LightGBM 强 0.03 比特以上,创新点是把连续输入和离散输出分开建模,值得做时序预测的人一看。原文稍后读已读值得跟进有用关注 VAIOM
09:50官方账号arXiv cs.AI@Katie Everett该论文揭示了Transformer前馈块中跳接和归一化不仅控制幅度,还通过调整分支与跳接的比例来保留梯度的秩。实验表明Pre-Norm使秩趋于平稳,而Post-Norm导致秩崩溃。双矩阵结构的宽度扩展遵循Marchenko-Pastur律,在CIFAR-10上输入-输出雅可比矩阵的初始化秩可预测网络训练性能。论文Transformer秩崩溃初始化推荐理由:想搞懂Transformer为什么深了还能训练?这篇从秩角度拆解跳接、归一化、双矩阵的设计逻辑,比堆实验更透彻。原文稍后读已读值得跟进有用关注 Transformer
00:55官方账号Microsoft Research@MSFTResearch微软CVP Doug Burger与研究员Subutai Ahmad、Nicolò Fusi讨论人类记忆与机器智能的根本差异。他们指出人类在分心数小时后难以记住新密码,而Transformer模型能轻松完成。该讨论对比了神经科学与人工智能的核心区别。行业微软Transformer人类记忆推荐理由:微软大佬们聊了个有趣的话题:为啥你记个密码这么费劲,Transformer却轻轻松松,值得一看原文稍后读已读值得跟进有用关注 微软
10:05官方账号arXiv cs.LG@Sigma Jahan研究者提出ROBIN方法,通过敏感度分析排序注意力头并移除偏见子空间。在四个模型的实验中,ROBIN在所有模型上降低了WinoBias差距,同时保持了语言建模质量,优于整体置零方法。这些初步结果表明头级偏见修复不仅要考虑选择哪些头,还要考虑如何修改。论文TransformerROBINWinoBias推荐理由:这篇论文给出了一个白盒方法ROBIN,能精准定位模型中的偏见注意力头并修复,比直接抹掉整个头效果好。原文稍后读已读值得跟进有用关注 Transformer
09:18官方账号arXiv cs.AI@Mehdi Saeedi, Eddie Richter, Paul Hartke本文研究用44.8M参数的编码器-解码器Transformer进行量子电路合成。在参数化电路(2-6 qubits)上,混合方法(结构来自Transformer,角度来自经典优化)对3-6 qubit电路实现中位数保真度1.000。在Clifford+T电路(3-6 qubits)上,模型虽能学习有效语法和准确T计数,但精确等价率从≤9门的88%跌至超过26门时接近零。推理时生成多候选并通过等价验证选择,将精确匹配率从7%提升至22.5%;训练数据扩展2.5倍则提升至39.5%,但长电路退化仍存在。结论:当需要完全离散正确性时,自回归漂移限制可靠性,推理时搜索和数据扩展有效,而微调和模型多样化无效。论文Transformer量子电路Clifford+T推荐理由:这篇论文揭示了量子电路合成里Transformer的一个关键问题:自回归漂移让长电路精确匹配率从88%几乎归零,即使数据翻倍也只能部分缓解,值得搞量子计算和AI交叉的人看。原文稍后读已读值得跟进有用关注 Transformer
03:07Ate-a-Pi@svpino精选一本包含50个动手项目的书籍,用Python、PyTorch、Scikit-Learn等工具教你理解大型语言模型内部机制。项目覆盖分词、嵌入、输出logits、Transformer输出、注意力、MLP等核心主题。每个项目配有解决方案,如运用HellaSwag评估模型、用cosine相似度分析嵌入、实现logit lens等方法。完成全部项目可进入该领域前0.01%的水平。技巧LLMPyTorch实战项目推荐理由:想扎实掌握LLM原理?这50个实战项目从基础分词到高级注意力分析,用PyTorch一步步搭出来,比看论文快多了。原文稍后读已读值得跟进有用关注 LLM
12:20官方账号arXiv cs.LG@Tiberiu Musat, Tiago Pimentel, Nicholas Zucchet, Thomas Hofmann这篇论文提出了一个理论框架,解释Transformer语言模型如何涌现归纳推理能力。它统一了包括in-context n-grams和多跳推理在内的多种合成任务。作者证明,注意力模型的训练动力学可以限制在高度可解释的低维不变流形上,该流形用少量坐标而非数百万参数描述学习过程。利用该框架,他们分析了数据统计如何决定in-context学习与in-weights学习的竞争,并展示了流形坐标可自动检测模型学到的电路。这为预测Transformer学习行为提供了理论步骤。论文Transformer归纳推理学习动力学推荐理由:这篇论文用数学方法搞清楚了Transformer在归纳推理任务中怎么学习不同策略,还解释了in-context和in-weights学习谁赢跟数据统计有关,挺有启发性。原文稍后读已读值得跟进有用关注 Transformer
12:10官方账号arXiv cs.LG@Romain Amigon该论文提出了一种结合自回归Transformer控制器(强化学习训练)和人工蜂群算法(ABC)的混合NAS框架,可在消费级GPU(NVIDIA RTX 3060)上运行。在CIFAR-10数据集中,该方法用3小时搜索到参数量约17.4万的架构,达到84.85%准确率,规模和搜索成本均低于ResNet-20。在信用卡欺诈检测任务上,优化F1-Score达到0.71,模型仅需约4600参数。该框架解决了元启发式方法的冷启动问题,并通过深度惩罚抑制模型臃肿。论文NASTransformer神经架构搜索2 个信源在谈事件专题推荐理由:这篇论文告诉你,不用几千GPU天也能搜出好架构,普通3060显卡3小时就能找到比ResNet-20更小的CIFAR-10模型,还能直接优化欺诈检测的F1分数。原文稍后读已读值得跟进有用关注 NAS
12:00官方账号arXiv cs.LG@Michael Rizvi-Martel, Satwik Bhattamishra, Guillaume Rabusseau, Michael Hahn这篇论文聚焦Transformer的理论理解,指出已有研究大多分析其表达性,但很少涉及可学习性。受损失景观分析启发,作者初步提出了学习C-RASP构造的样本复杂度边界。该工作为理解Transformer在有限样本下的学习能力提供了理论基础。论文TransformerC-RASP样本复杂度推荐理由:这篇论文讲了Transformer的理论短板——表达性研究够了,但学不学得会还不知道。他们用C-RASP给出了样本复杂度的初步界限,对想深挖模型理论的人很有用。原文稍后读已读值得跟进有用关注 Transformer
10:56官方账号arXiv cs.LG@Byung Gyu Chae该研究在Pythia语言模型中提取Transformer层雅可比矩阵的松弛谱,直接测量了弛豫态密度(TDOS)、记忆自能、遗忘间隙、记忆核和红外临界指数。测量发现慢弛豫模式呈现红外累积,产生近似平坦的TDOS(ρ(λ)~λ^{-0.1})和标度无关的记忆核(K(t)~t^{-1})。记忆自能在早期优化中出现瞬态最大值,随后松弛到近临界亚稳态,此时遗忘间隙最小、集体磁化率最大。这些定量实验证据表明Transformer动力学受红外集体组织支配,且该行为在不同训练阶段、网络深度和模型规模下均可复现。论文PythiaTransformer认知场理论推荐理由:这篇论文用Pythia模型实测了Transformer内部动力学的红外组织现象,发现记忆核呈标度无关性,挺硬核的理论研究。原文稍后读已读值得跟进有用关注 Pythia
09:40官方账号arXiv cs.LG@Gabriel Mahuas, Victoria Shevchenko, Ugo Tanielian, Yassir Bendou, Richard Gao该论文提出CoCoT-EEG,一种对比预训练的多尺度卷积Transformer模型,用于脑电图解码。在多个异构电极配置的基准任务上,CoCoT匹配或超越了基于掩码重构预训练的最先进模型。从零开始训练的CoCoT也优于先前单任务解码模型,展现出数据效率。通过系统消融实验,作者验证了对比学习用于构建EEG基础模型的可行性,并指出关键架构设计考量。论文CoCoT-EEG对比学习EEG解码推荐理由:这篇论文用对比学习做EEG预训练,比传统掩码重构效果好,架构设计很实在,搞脑机接口的可以看看。原文稍后读已读值得跟进有用关注 CoCoT-EEG
18:08AI Will@FinanceYF5该视频教程通过5个阶段(LLM入门、Transformer架构、训练过程、模型现代化改造、扩展)完整演示如何从零构建大语言模型。作者全程边讲边敲代码,覆盖ChatGPT、Claude等模型的核心原理。视频时长3小时,代码全程可见,适合想深入理解LLM工作原理的开发者。技巧LLMTransformer训练过程推荐理由:想搞懂ChatGPT和Claude怎么造出来的?这个3小时教程从零敲代码,全程干货,比看书快多了。原文稍后读已读值得跟进有用关注 LLM
10:15官方账号arXiv cs.LG@Anna Kuzina, Paul N. Whatmough, Babak Ehteshami Bejnordi72°论文揭示了因果自注意力二次复杂度对长上下文推理的瓶颈,在冻结骨干网络下隔离了状态更新设计的效果。研究表明Softmax依赖key相关的秩1正交投影,解释了为何delta式网络优于纯门控累积。作者通过引入sink token、短卷积和固定预算缓存路由等结构干预,减少了近似误差。在LLaMA和Qwen模型上扩展至32B参数,MMLU基准超越了先前后验线性化方法,长上下文检索匹配复杂自适应缓存框架。论文LLaMAQwenTransformer1 个信源在谈事件专题推荐理由:这篇论文搞清楚了Transformer线性化为什么delta式更厉害,还给出了具体修补方案,在LLaMA和Qwen上跑到了32B,MMLU成绩比之前的后验方法好。原文稍后读已读值得跟进有用关注 LLaMA
09:57官方账号arXiv cs.LG@Eitan Levin, Venkat Chandrasekaran该论文提出使用随机采样映射(如替换采样、随机分箱、物种采样)来比较不同大小的输入(如点云点数量不同、序列token长度不同、图节点数不同)。通过分析领域内问题实例的对称性,确定了每种采样类型的适用场景。框架给出了函数类连续性的显式泛化率和草图化率,涵盖序列、图和张量上的函数族。具体例子包括矩多项式、同态密度、置换不变Transformer和图神经网络。论文采样泛化图神经网络推荐理由:这篇论文提出了一个统一的采样框架,帮你理解模型在不同大小输入上的泛化能力,还能把大输入压缩成小输入来节省计算,例子涵盖Transformer和图神经网络。原文稍后读已读值得跟进有用关注 采样
09:34官方账号arXiv cs.AI@Azwar Abdulsalam, Nishil Patel, Andrew Saxe论文在可观测的符号重写语法环境中研究RL后训练能否组合原始技能。Transformer在原始符号重写链上预训练,后通过二元最终答案奖励的Trace推理任务进行RL训练。RL能解决预训练模型即使加大采样预算也极少解决的难题,而拒绝微调早期有提升但随后停滞。Trace分析显示RL通过阶段性组合机制:先强化原始缩减,再发现有效组合过程,包括顺序组合和并行组合。对比表明RL相较于拒绝微调的关键差异不在于探索量,而在于选择性——RL将探索聚焦于有效可复用结构。论文TransformerRLrejection fine-tuning推荐理由:这篇论文用可控实验证明了RL后训练能从头组合出高级推理策略,不是只增强已有技能,对理解强化学习训练机制很有启发。原文稍后读已读值得跟进有用关注 Transformer
10:02官方账号arXiv cs.LG@Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang电子健康记录基础模型(FEMR)预训练于大规模结构化患者数据,但缺乏可解释性。X-FEMR训练一个Transformer代理模型来近似FEMR在两个预测任务上的行为。该方法识别最影响预测的token,揭示患者历史不同方面的重要性。引入临床对齐度量,量化代理模型关键token与临床验证特征的一致性。实验表明代理模型能很好近似FEMR预测,token级解释与临床知识对齐。论文FEMRX-FEMRTransformer推荐理由:这篇论文用Transformer代理模型给医疗AI做局部解释,还能直接对齐临床知识,让黑箱诊断更可信。原文稍后读已读值得跟进有用关注 FEMR
12:04官方账号arXiv cs.LG@Sanjeev Shrestha, Hui Liu, Yifan ZhangExformer提出极端自适应注意力机制,包含Local、Stride和Extreme三个稀疏组件,分别捕捉短期、周期性和事件依赖。在4个真实水文数据集上,Exformer在3天预报任务中优于State-of-the-Art基线。该模型显式建模正常与极端流模式的依赖关系,提升了在高度偏态分布数据上的预测能力。AI模型ExformerTransformer时间序列预测推荐理由:这篇论文的Exformer模型专门处理时间序列中的极端事件,比如洪水,比普通Transformer在3天预报上表现更好。原文稍后读已读值得跟进有用关注 Exformer
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。论文Qwen3GRPOTransformer推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。原文稍后读已读值得跟进有用关注 Qwen3
11:04官方账号arXiv cs.AI@Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi该论文提出状态-预测分离假设,认为Transformer中预测下一个token与存储有用状态可被分离。作者设计双流Transformer变体,将两个功能分配到不同计算流。在多个规模下的预训练实验中,该方法在数据和计算效率上持续优于标准Transformer,验证损失更低,下游任务平均提升2-3个百分点。额外实证分析排除了潜在混淆因素,揭示了设计带来的梯度差异。论文Transformer状态-预测分离语言建模推荐理由:这篇论文把Transformer的预测和记忆分开了,实验证明效果更好,下游任务平均提了2-3个点,搞LLM架构的值得细看。原文稍后读已读值得跟进有用关注 Transformer
16:57量子位@衡宇卡帕西、李飞飞、辛顿等AI领域知名人物共同投资了这家开发Transformer专用芯片的公司。该芯片针对Transformer架构进行了硬件优化,专为加速AI推理设计。公司已签下一份价值10亿美元的大订单。目前芯片已成功流片,进入量产准备阶段。AI产品Transformer卡帕西李飞飞推荐理由:卡帕西、李飞飞、辛顿都投了这家做Transformer专用芯片的公司,刚签下10亿美元大单,芯片已流片,值得一看。原文稍后读已读值得跟进有用关注 Transformer
10:32官方账号arXiv cs.AI@Srijan Tiwari, Aditya Chauhan, Manjot Singh该论文对神经网络在算法任务上的延迟泛化(grokking)现象进行几何分析,发现交叉熵优化下隐藏表示的径向膨胀是延迟的主因。作者提出径向-角分解并推导三个可检验命题,引入单一超参数范数惩罚将激活约束在 sqrt(d) 半径超球面上。在模算术任务上,该惩罚使 MLPs 和 Transformers 的 grokking 加速高达 6 倍;对 10M 参数的 nanoGPT 在 3 位数加法上训练步数减半。论文Grokking泛化几何分析推荐理由:这篇论文用几何视角解释了神经网络为什么先死记硬背后突然泛化,还找到了一个简单技巧(约束隐藏层半径)让 grokking 快 6 倍,值得搞训练的人看看。原文稍后读已读值得跟进有用关注 Grokking
10:08官方账号arXiv cs.AI@Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu论文提出一种操作级视觉令牌跳过框架,将Transformer层分解为注意力与FFN操作,选择性跳过冗余计算。实验覆盖3种MLLM架构(含Qwen3-VL)和10个VQA基准,实现精度-效率权衡:在Qwen3-VL上减少33.7% TFLOPs,保留99.5%的原始性能。关键发现是晚期视觉令牌更新对答案表示影响很小,且有效计算具有操作主导性和层依赖性。论文MLLMQwen3-VL推理加速推荐理由:这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。原文稍后读已读值得跟进有用关注 MLLM
14:30AI Will@FinanceYF5Christopher Manning(GloVe词向量、Transformer注意力机制联合发明人)将于Stanford HAI发表演讲。他曾获2024年IEEE John von Neumann Medal。演讲主题聚焦世界模型,探讨语言模型遇上具身智能。他是Stanford NLP Group创始人及CS224N课程创建者。行业Christopher ManningGloVeTransformer推荐理由:GloVe和Transformer的创造者Manning要讲语言模型怎么和机器人结合了,想了解具身智能世界模型的可以听听。原文稍后读已读值得跟进有用关注 Christopher Manning
09:59官方账号arXiv cs.LG@Peilin Liu, Ding-Xuan Zhou论文提出一个基于分布回归的Transformer学习框架,将两阶段采样过程与自然语言处理关联。定义了注意力算子,证明Transformer可无损压缩分布为函数表示。相比卷积神经网络和全连接网络,Transformer在更复杂结构的功能学习上表现更强。该框架还为大语言模型中的提示调优、参数高效微调、高效缩放等技术提供理论洞见。论文Transformer注意力机制分布回归推荐理由:这篇论文给Transformer的提示调优、微调等技术找到了数学理论,解释了为什么注意力机制能压缩信息。原文稍后读已读值得跟进有用关注 Transformer
02:49官方一手Hugging Face: Blog(博客/媒体)精选Allen AI 发布 DiScoFormer,一种基于 Transformer 的架构,同时学习任意数据分布的密度函数和得分函数。传统方法如 NICE、MAF、ResFlow 需分别建模或使用归一化流,DiScoFormer 通过单一模型完成且无需显式归一化。在 2D 环形、高维高斯混合等多个基准分布上,DiScoFormer 的密度估计和得分误差均低于这些基线。该论文已被 NeurIPS 2024 接收,代码和预训练模型已在 GitHub 开源。AI模型DiScoFormerAllen AITransformer推荐理由:Allen AI 搞了个新模型 DiScoFormer,一个 Transformer 既能算密度又能算得分,比 NICE 这些老方法误差更低。想省事搞密度估计的可以看看。原文稍后读已读值得跟进有用关注 DiScoFormer
10:10官方账号arXiv cs.AI@Abdolazim Rezaei, Mehdi Sookhak, Mahboobeh Haghparast论文提出参数高效混合Transformer(PEHT),将LoRA集成到Transformer编码器中以减少可训练参数,同时在解码器中融合外部移动性和拥堵特征。在Telecom Italia Milan数据集和多个合成拥堵场景上的实验显示,PEHT在RMSE、MAE和R²指标上优于现有基线。该模型针对动态城市蜂窝网络中的资源分配优化,代码已在GitHub开源。AI模型PEHTLoRA网络流量预测推荐理由:想用Transformer预测城市网络流量?这个PEHT用LoRA大幅减少参数,还能融合拥堵数据,实测精度超过现有方法。原文稍后读已读值得跟进有用关注 PEHT
11:01AI Will@FinanceYF5精选Jayden Teoh提出Next-Latent Prediction(NextLat),一种自监督学习方法。该方法教Transformer预测下一个隐状态而非直接预测token。NextLat使模型形成紧凑的世界模型,在推理和规划任务上表现更好。通过自speculative decoding,推理速度最高提升3.3倍。AI模型NextLatTransformer推理模型推荐理由:Transformer预测隐状态而不是token能加速3.3倍,还能形成世界模型。Jayden Teoh的新框架值得看看。原文稍后读已读值得跟进有用关注 NextLat
18:03IT之家(博客/媒体)富士通发布了PHOTON架构,在多查询场景下性能最高可达Transformer架构的475倍。该架构通过语义分层处理替代词元级分割,降低计算复杂度并提升并行性。测试显示,在600M、900M和1.2B参数模型上,PHOTON实现了更高的迭代吞吐量和更低的内存占用。其中1.2B模型性能提升475倍,但质量略有下降。AI模型富士通PHOTONTransformer推荐理由:富士通新架构PHOTON在多查询任务上比Transformer快475倍,1.2B小模型实测,省内存省GPU。原文稍后读已读值得跟进有用关注 富士通
00:51官方一手Hugging Face: Blog(博客/媒体)精选NVIDIA 发布 NeMo AutoModel,通过自动化模型并行、混合精度训练和梯度检查点,简化 Transformer 模型微调流程。该工具可自动检测硬件配置,支持多 GPU 分布式训练,无需手动调整参数。在微调 BERT-base 模型时,相比标准 PyTorch 实现,NeMo AutoModel 将训练时间缩短约 40%,并保持相同精度。技巧NVIDIANeMoAutoModel2 个信源在谈事件专题推荐理由:NVIDIA 搞了个 NeMo AutoModel,能自动帮你加速微调 Transformer 模型,省去手动调参的麻烦,速度还快很多,适合想快速出结果的人。原文稍后读已读值得跟进有用关注 NVIDIA
11:40官方账号arXiv cs.LG@Jinghan Wang, Feng Cheng, Wentao Wu, Hang Li, Gaoliang Peng, Tianchen Liu该论文提出一种知识引导的两阶段迁移学习框架,核心是一个轻量级GPT-2风格Transformer,利用因果自注意力从振动信号中分层提取特征。框架通过多源预训练学习通用表示,并借助原型知识调制和分类自适应实现跨域迁移。在4个真实数据集上,仅用10%标签数据即达92.61%平均准确率,比现有最佳方法高17.24个百分点。该方法为工业4.0低成本预测性维护提供了可行方案。论文GPT-2Transformer轴承故障诊断推荐理由:这篇论文把GPT-2用在轴承故障诊断上,只用10%的标签数据就比SOTA高了17个百分点,工业场景下很实用。原文稍后读已读值得跟进有用关注 GPT-2
09:38官方一手arXiv: Anthropic@Guruprakash J, Krithika L. B该综述将Transformer架构分为encoder-only、decoder-only、encoder-decoder、长上下文、置换基与生成对抗等变体,并涵盖2023年后指令微调、RLHF、DPO、MoE、RAG等进展。它梳理了OpenAI、Anthropic、Google、Meta、Mistral、DeepSeek等主流模型家族。在应用侧调研了医疗、金融、法律、教育等7个领域的部署。论文从参数规模与能耗的权衡、对齐方法、数据溯源及基准饱和四个维度评估模型。它还点名了值得关注的开放研究问题。论文Transformer语言模型综述10 个信源在谈事件专题推荐理由:想快速搞懂主流Transformer架构和各家模型?这篇综述帮你理清了架构分类和应用场景,还比较了参数和能耗,适合做调研入门。原文稍后读已读值得跟进有用关注 Transformer
13:13官方账号arXiv cs.AI@Reza Bayat, Ali Behrouz, Aaron Courville当前语言模型在深度上均匀分配参数,但研究表明各层贡献不同。该论文在固定预算下实验发现,将更多参数分配给前层、减少后层可以改进困惑度。提出Tapered Language Models(TLMs),通过余弦调度平滑锥形化MLP宽度。在Transformer、Gated Attention、Hope-attention和Titans四种架构上,三个模型尺度均一致提升困惑度和下游基准性能,且不增加参数或计算量。论文Tapered Language ModelsTransformerTitans推荐理由:这篇论文发现了一个简单技巧:同等算力下,把更多参数分给前几层、少给后几层,模型效果就能更好,试了多种架构都管用。原文稍后读已读值得跟进有用关注 Tapered Language Models
12:49官方账号arXiv cs.LG@Tianyi Li, Zhiqiang Shen现有线性模式连通性方法通常只从一个模型端点优化插值路径,难以扩展到大型Transformer。我们提出新框架,应用功能保持的权重变换对齐等价解,并让两个模型双向学习向共享线性插值路径的变换。双向优化大幅减少插值障碍,在中等参数规模语言模型上实现了WikiText近零损失屏障(首次展示该规模下近无屏障线性连通)。视觉领域ViT-L在插值路径上保持ImageNet top-1准确率超69%,十亿参数LLM只表现出小损失屏障。这些结果表明解决参数对称性能使大预训练Transformer通过简单线性路径连通和合并。AI模型Linear Mode ConnectivityTransformer模型合并推荐理由:新方法让十亿参数Transformer通过双向学习实现线性合并,损失屏障极低,视觉和语言模型都验证有效。原文稍后读已读值得跟进有用关注 Linear Mode Connectivity