00:42berryxia@berryxiaSakana AI是一家2023年在东京成立的AI研发公司,由David Ha(前Google Brain日本团队负责人)、Llion Jones(Transformer论文共同作者)和Ren Ito(前日本外交官、Mercari早期员工)联合创立。公司核心定位是开发“自然启发”的AI模型,强调集体智能和演化方法,旨在摆脱单一大模型限制。该公司的创办背景体现了日本AI主权的战略需求,团队和运营完全基于东京。行业Sakana AIDavid HaLlion Jones推荐理由:这家日本AI公司有Transformer论文作者和前Google Brain负责人,主打集体智能,背景扎实值得看。原文稍后读已读值得跟进有用关注 Sakana AI
12:57官方一手歸藏(guizang.ai)@op7418精选71°Noam Shazeer(Transformer论文作者之一、MoE架构提出者)加入OpenAI,负责模型架构研究。谷歌此前以27亿美元收购Character.AI换取他加入谷歌。但Shazeer在谷歌停留短暂后即转投OpenAI。行业Noam ShazeerTransformerMoE10 个信源在谈事件专题推荐理由:Transformer论文作者Noam Shazeer,MoE提出者,跑到OpenAI研究模型架构了,谷歌27亿美元白花了?原文稍后读已读值得跟进有用关注 Noam Shazeer
11:43官方账号arXiv cs.LG@Qingyang Zhu, Eric Karl Oermann, Kyunghyun Cho该研究提出多任务上下文学习框架用于分层贝叶斯预测推理,将先验信息表示为上下文数据集的前缀。使用Transformer在序列先验和目标任务上训练,学会跨先验家族调整预测。在包含元分布外先验和高维潜在结构的评估中,该方法匹配oracle贝叶斯预测器,速度提升数个数量级。在真实世界时空温度预测基准上验证了实际效果。论文贝叶斯推理上下文学习多任务学习推荐理由:这篇论文提出多任务贝叶斯ICL框架,速度比传统方法快几个数量级,还能适应新先验,在温度预测上表现很好。原文稍后读已读值得跟进有用关注 贝叶斯推理
00:35官方账号Microsoft Research@MSFTResearch微软研究院的Subutai Ahmad和Nicolò Fusi与公司副总裁Doug Burger探讨人类记忆与机器智能的差异。他们发现Transformer架构能通过持续五小时的故事输入记住一个新密码。这项对比研究揭示了机器在长期信息保留上的独特优势。相关讨论视频已在Twitter上发布。行业Transformer微软记忆机制推荐理由:微软研究员拿Transformer和人类比记忆:听五小时故事,它能记住新密码,你行吗?看看具体差异在哪。原文稍后读已读值得跟进有用关注 Transformer
18:19Aadit Sheth@aaditsh88°据X用户aaditsh透露,谷歌在2024年支付27亿美元,这笔交易的主要目的是将Transformer论文合著者Noam Shazeer从Character.ai带回。但Noam在谷歌工作不到两年后,于2026年宣布加入OpenAI。这相当于每月超过1亿美元的人才成本。Noam曾用几行训练代码拯救了Gemini项目,现在将参与OpenAI的架构建设。行业Noam ShazeerGoogleOpenAI10 个信源在谈事件专题推荐理由:Noam Shazeer刚加入OpenAI,之前谷歌花27亿签他都没留住。你想知道AI圈顶级人才有多贵吗?点开看看。原文稍后读已读值得跟进有用关注 Noam Shazeer
17:29官方账号Amazon Science@AmazonScience亚马逊AI、芯片与量子负责人Peter DeSantis在VivaTech表示,最大的AI突破尚未到来。他认为Transformer不会是最后一个AI架构,现有模型架构将被超越。芯片和模型必须协同进化,才能实现未来突破。这一观点挑战了当前以Transformer为主流的AI发展路径。行业AmazonPeter DeSantisTransformer推荐理由:亚马逊的AI老大说了,Transformer不是终点,芯片和模型得一起进步才能搞出大新闻。原文稍后读已读值得跟进有用关注 Amazon
15:25官方账号Decoder@Matthias BastianNoam Shazeer是2017年Transformer论文《Attention Is All You Need》的合著者,曾共同领导Google Gemini模型。2024年他作为27亿美元交易的一部分从Character.AI重返Google,现又转投OpenAI。这是继Andrej Karpathy跳槽Anthropic后,今年AI行业第二次重大高管变动。行业Noam ShazeerOpenAIGoogle10 个信源在谈事件专题推荐理由:Transformer论文作者Noam Shazeer从Google跳到OpenAI了,他去年刚从Character.AI回归Google,这次跳槽节奏很快。原文稍后读已读值得跟进有用关注 Noam Shazeer
13:13IT之家(博客/媒体)88°Noam Shazeer是2017年Transformer论文主要作者,曾因谷歌拒绝发布聊天机器人Meena(后演变为LaMDA)于2021年离职创办Character.AI。2024年8月,谷歌以27亿美元技术许可协议将其请回,他担任Gemini项目技术负责人并推动Gemini 3登顶多项排行榜。2026年2月他当选美国国家工程院院士。如今他宣布加入OpenAI,促使OpenAI CEO Sam Altman称其为最想合作的人之一。至此Transformer论文八位作者全部离开谷歌。行业TransformerOpenAI谷歌10 个信源在谈事件专题推荐理由:Transformer之父二度出走,从谷歌跳到OpenAI。他发明了现代大模型的核心架构,这次跳槽说明顶级AI人才争夺有多激烈。原文稍后读已读值得跟进有用关注 Transformer
11:12官方一手歸藏(guizang.ai)@op7418精选81°Noam Shazeer,Character AI前CEO、Transformer论文作者之一及混合专家模型(MoE)架构提出者,宣布加入OpenAI。谷歌曾以27亿美元收购Character AI,旨在换取Shazeer加入,但他仅在谷歌短暂任职后便离职。Shazeer在社交媒体确认新职位,称期待与OpenAI团队合作。行业Noam ShazeerOpenAITransformer10 个信源在谈事件专题推荐理由:Transformer和MoE的发明者从谷歌跳到OpenAI了,看看他能为GPT-5带来什么新架构。原文稍后读已读值得跟进有用关注 Noam Shazeer
11:06官方账号Sam Altman@sama88°OpenAI CEO Sam Altman 发推表示,自公司成立之初就一直想与 Noam Shazeer 共事,如今历经10年终于实现。Noam Shazeer 是 Transformer 论文的共同作者之一,也是 Character.AI 的联合创始人。他此前在 Google 工作多年,此次从 Google 跳槽至 OpenAI。Shazeer 本人发推确认加入,并称做出这个决定很艰难。行业Noam ShazeerOpenAITransformer10 个信源在谈事件专题推荐理由:Transformer 共同作者 Noam Shazeer 从 Google 跳槽到 OpenAI,Altman 期待了10年,这个人加入可能会影响下一代模型研发。原文稍后读已读值得跟进有用关注 Noam Shazeer
10:57官方账号arXiv cs.LG@Yaniv Livertovsky, Shahar Somin, Gonen SingerCAHP将注意力头选择重新定义为全局图论问题,利用图聚类和信息论距离识别互补子集。该方法无需预定义稀疏度,通过检测边际性能下降曲线自动确定每层保留的头数。在SST-5和MNLI基准上,CAHP在不同规模Transformer中均优于梯度方法,尤其在高压缩率下。结构分析表明,CAHP避免了梯度方法的“邻近偏差”,保留了模型中间层的功能关键头。论文CAHPTransformer注意力头剪枝推荐理由:想压缩Transformer模型?CAHP自动剪掉冗余注意力头,不用调参,在SST-5和MNLI上比梯度方法更强,还保住了中间层的关键结构。原文稍后读已读值得跟进有用关注 CAHP
10:45官方账号arXiv cs.AI@Sajad Movahedi, Vera Milovanović, Shlomo Libo Feigin, Alexander Theus, Thomas Hofmann, Valentina Boeva, T. Konstantin Rusch, Antonio Orvieto循环架构通过循环利用层数为组合推理任务提供逐步推理的归纳偏置。随着循环深度增加,信号传播问题加剧,影响模型性能。本文提出FPRM,一种基于Transformer的固定点推理模型,采用预归一化层和残差缩放解决信号传播,并以固定点收敛作为端到端停止机制。FPRM在Sudoku、Maze、状态跟踪和ARC-AGI基准上验证了有效性。论文FPRMTransformer固定点推理推荐理由:这篇论文提出了FPRM,用固定点收敛让循环推理深度自适应任务难度,在Sudoku和ARC-AGI上效果不错,适合关注推理架构的人。原文稍后读已读值得跟进有用关注 FPRM
10:15官方账号arXiv cs.LG@Viet-Hoang Tran, Vinh Khanh Bui, Van-Hoan Trinh, Tan Lai Ngoc, Tan M. Nguyen精选这篇论文研究了Transformer中注意力机制的函数等价性,重点分析了sinusoidal和旋转位置编码(RoPE)两种变体。作者发现sinusoidal编码保留了普通注意力的等价结构,而RoPE显著减小了对称群,从而增强了表达力。这一发现为RoPE在实践中的流行提供了理论解释。论文还讨论了位置编码如何影响线性模式连接性,并通过对齐算法证明连接性的存在和变化关键依赖于位置编码。实验表明使用RoPE的Transformer在参数空间具有更少的函数等价性,有助于优化和泛化。论文TransformerRoPE位置编码推荐理由:这篇论文解释了为啥RoPE比Sinusoidal位置编码更受青睐——它减少了参数空间的对称性,让Transformer表达力更强。如果你好奇背后的理论,值得一看。原文稍后读已读值得跟进有用关注 Transformer
09:41官方账号arXiv cs.AI@Andrea Santomauro, Luigi Portinale, Giorgio Leonardi本研究从理论和实验两方面分析了相似性位置编码(simPE)在旋转扰动下的鲁棒性。论文首先证明simPE通常不具备旋转不变性,但基于Lipschitz假设推导出其在Frobenius范数下的显式扰动界。实验在四个数据集(Arrow、Shapes、Digits、FashionMNIST)上进行,测试图像逐渐增大旋转角度,simPE在准确率、F1、精确率和召回率上均优于标准学习型位置编码,尤其在小到中等旋转角度下表现更优。论文simPE位置编码鲁棒性推荐理由:这篇论文证明了simPE在图像旋转下比标准位置编码更稳,用四个数据集给出了理论界和实验验证,做视觉Transformer的值得看。原文稍后读已读值得跟进有用关注 simPE
09:48官方账号arXiv cs.LG@Tien Thanh Thach本文提出改进的Transformer架构,结合余弦退火调度和移位数据增强(SDA)用于一步股票指数预测。在VN30和S&P 500两个基准数据集上评估,余弦退火调度相比逆幂调度持续提升预测精度。SDA显著降低预测误差和运行间变异,提高对超参数选择的鲁棒性。组合方法在两个数据集上取得最佳性能,表明数据增强比增加模型复杂度更有效。论文TransformerSDA股票预测推荐理由:这篇论文在股票预测上用改进的Transformer和数据增强,在VN30和标普500上效果比堆模型还管用,值得看看具体方法。原文稍后读已读值得跟进有用关注 Transformer
11:12官方账号arXiv cs.LG@Armand de Villeroché, Sibo Cheng, Vincent Le Guen, Marc Bocquet, Rem-Sophia Mouradi, Patrick Armand, Alban Farchi, Patrick MassinTransformer神经算子在复杂几何PDE求解中表现出色,但现有方法假设固定域大小限制泛化。本文提出可分解注意力偏置与旋转位置编码,实现空间局部性和平移等变性,使模型在训练域2倍、4倍更大的域上零样本推理。在2个PDE基准(Navier-Stokes、Darcy)和1个3D工业大气流动应用中,该方法显著提升零样本泛化性能。代码和数据集已公开在GitHub。论文Transformer神经算子零样本泛化推荐理由:零样本推理更大域的新方法原文稍后读已读值得跟进有用关注 Transformer
11:12官方账号arXiv cs.AI@Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa PolyzouTransformer ASR模型如Whisper预测难解释。LEAF-X框架结合熵引导注意力加权、多层注意力展开和因果消融,定位低熵高影响头与层,生成稀疏token-帧归因。相比扰动解释器或原始注意力图,LEAF-X更好反映模型计算,忠诚度提升32%,局部性/稀疏性增强35-39%,归因最稳定。论文WhisperLEAF-X可解释性推荐理由:Whisper解释性更好用了原文稍后读已读值得跟进有用关注 Whisper
01:21Aadit Sheth@aaditsh精选Andrej Karpathy(前特斯拉 Autopilot AI 负责人)发布了一门 3.5 小时的免费课程,详细讲解 ChatGPT 的工作原理。课程涵盖 Transformer 架构、训练流程(预训练、微调、RLHF)等核心内容。该课程完全免费,旨在普及大语言模型知识。技巧Andrej KarpathyChatGPTTransformer推荐理由:Karpathy 免费教 ChatGPT 原理原文稍后读已读值得跟进有用关注 Andrej Karpathy
16:13官方一手marktechpost@Asif RazzaqZyphra 发布了 Zamba2-VL 系列开源视觉语言模型,包含 1.2B、2.7B 和 7B 三个参数版本。该模型采用混合 Mamba2 状态空间和 Transformer 骨干架构,在 Apache 2.0 许可下发布。与同类 Transformer 视觉语言模型相比,Zamba2-VL 在保持竞争力的同时,将首 token 生成时间降低了约一个数量级。这标志着在高效视觉语言推理方面的重要进展,尤其适合对延迟敏感的应用场景。AI模型视觉语言模型Mamba2Transformer推荐理由:做视觉语言模型部署或实时推理的开发者,Zamba2-VL 的首 token 延迟优势能显著提升用户体验,值得直接尝试。原文稍后读已读值得跟进有用关注 视觉语言模型
12:20官方账号Tri Dao (FlashAttention)@tri_dao精选通过数学重写,研究者发现 Transformer 的所有操作本质上可以归结为一系列 GEMM(通用矩阵乘法)加 epilogue(后处理)。这意味着只要提供几个优化好的基础原语,LLM 甚至新手人类都能为所有 Transformer 操作编写达到光速的内核。这一发现简化了模型优化,让高性能内核的编写门槛大幅降低。论文TransformerGEMM内核优化推荐理由:对做模型推理优化和内核开发的团队来说,这揭示了 Transformer 的底层统一结构,可以直接用 LLM 生成高效代码,建议关注。原文稍后读已读值得跟进有用关注 Transformer
09:38官方账号arXiv cs.LG@Abubakar Hamisu Kamagata, Dharm Singh Jat, Attlee Munyaradzi Gamundani, Abhishek Srivastava, Paramasivam Saravanakumar该研究提出一种物理引导的深度时空学习框架,用于从被动海岸视频流直接估算近岸波浪峰值周期。框架结合了基于时间方差的感兴趣区域检测、多阶段模拟到真实迁移学习以及物理信息正则化,提升了预测精度和物理一致性。实验表明,基于Transformer的架构在瞬时预测精度上表现最佳,而轻量级循环卷积架构在时间稳定性和海洋学技能上更优。消融研究证实了物理引导正则化在趋势一致性方面的优势,可解释性审计显示模型关注了水动力活跃的破浪区。该工作展示了基于视频的深度学习系统在长期、低成本海岸波浪监测中的潜力。论文物理引导深度学习波浪监测视频分析推荐理由:做海岸工程或海洋监测的团队,终于有了一个成本低、可解释的AI方案——从视频直接估算波浪参数,比布设浮标省钱省力,值得关注。原文稍后读已读值得跟进有用关注 物理引导深度学习
04:11Richard Socher@RichardSocherAndrej Karpathy 发布了一个新的 AI 基准测试,旨在评估从基础 Transformer 模型到高级 AI 系统的演进过程。该测试需要 AI 花费相当长的时间才能达到 Karpathy 的版本水平。这一基准测试可能用于衡量 AI 系统的复杂性和进步程度,对研究者和开发者具有重要参考价值。论文基准测试TransformerKarpathy推荐理由:Karpathy 的基准测试为 AI 开发者提供了一个衡量模型进化难度的新工具,做模型训练和评估的团队值得关注这个测试,看看自己的模型需要多久才能达到高级水平。原文稍后读已读值得跟进有用关注 基准测试
12:38官方账号arXiv cs.AI@Boyang Li, Yulin Wu, Sizhe Xu, Nuoxian Huang, Zhonghang Yuan, Shangyi Guo, Shu Yang, Takahiro Yabe精选nD-RoPE 是一种将旋转位置编码(RoPE)推广到任意维度的新方法。现有高维 RoPE 方法要么独立旋转每个轴,要么经验性地混合频率,限制了跨维度交互并导致方向依赖的表示。nD-RoPE 从连续希尔伯特空间的平移不变性出发,推导出各向同性的谱条件,要求将位置和频率视为耦合的 n 维向量。它采用多尺度正则单纯形波矢设计,提供非退化的空间覆盖和对称、方向平衡的二阶响应。在图像、视频和点云上的实验表明,nD-RoPE 在性能提升和泛化能力上均优于现有方法。论文位置编码RoPETransformer推荐理由:nD-RoPE 解决了高维位置编码缺乏统一理论框架的问题,做视觉、视频或点云 Transformer 的开发者可以直接用,能显著提升模型对空间结构的理解能力。原文稍后读已读值得跟进有用关注 位置编码
11:06官方账号arXiv cs.AI@Zhi Wei Xu, Torbjörn E. M. Nordling该论文提出了一种端到端的时空Transformer框架,用于在光照变化条件下通过RGB摄像头远程估计心率(rPPG)。方法结合了3D人脸对齐、光照增强、残差时间标准化模块和混合时频监督,显著提升了机器人环境下的心率估计鲁棒性。在包含三种光照水平的数据集上,该方法将心率平均绝对误差降至0.79 bpm,相关系数达0.982,相比PhysFormer基线误差降低93.6%。这项工作解决了服务机器人在日常光照变化中无法可靠感知用户生理状态的关键问题。论文rPPG心率估计机器人感知推荐理由:机器人需要感知用户心率来调整交互策略,但光照变化一直是部署的拦路虎——这个框架把误差压到了1 bpm以内,做服务机器人或辅助机器人开发的团队可以直接参考。原文稍后读已读值得跟进有用关注 rPPG
17:09Viking@vikingmute精选Viking 推荐了两篇深入讲解 Transformer 和 LLM 内部机制的文章。第一篇《Inside the Transformer: The Life of a Token》详细追踪了一个 Token 在现代 Transformer 中的完整前向传播过程,包含大量实战实现细节和精美图表,适合有一定基础的学习者作为进阶阅读。第二篇《How LLMs Actually Work》曾登顶 HackerNews,以深入浅出的方式、直观的比喻和代码示例,帮助有编程基础但未深入学过 Transformer 的读者理解 LLM 原理。Viking 强调写作乐趣,坚持不用 AI 辅助,保持文章的人味。论文TransformerToken前向传播推荐理由:两篇文章分别适合不同阶段的读者:进阶者可以看 Token 级追踪,初学者可以看 LLM 原理入门,都是活人写的干货,建议收藏慢慢啃。原文稍后读已读值得跟进有用关注 Transformer
10:39官方账号arXiv cs.LG@Yidan Shen, Neville Mathew, Maham Rahimi, Deependra Dhakal, George Zouridakis, Xin Fu, Renjie Hu该研究提出了一种名为DMT的Transformer网络,用于从PPG信号进行无袖带血压估计。模型通过FiLM风格的特征调制,将人口统计信息(如年龄、性别)嵌入Transformer的注意力与前馈子层,实现个性化表征学习。同时,引入辅助形态学头,引导模型关注与动脉硬化和波反射相关的波形形态,避免仅依赖振幅主导的捷径。在PulseDB数据集上,校准评估协议下,收缩压MAE为4.56 mmHg,舒张压为2.62 mmHg,相比此前人口统计增强的PPG基线,误差分别降低47%和50%。该轻量单传感器模型支持可扩展的临床级无袖带血压监测。论文血压估计PPG信号Transformer推荐理由:这项研究解决了PPG血压估计中忽视个体血管差异和形态特征的问题,做可穿戴健康监测的团队可以直接参考其轻量模型设计,校准场景下误差大幅降低,值得关注。原文稍后读已读值得跟进有用关注 血压估计
10:32官方账号arXiv cs.LG@Zach Moczkodan, Hany Ragab该研究重新评估了 Transformer 等时序架构在网络入侵检测中的真实效果,发现其性能提升主要来自 padding 方式而非架构本身。在无 padding 的真实序列上,Transformer 的 macro-F1 达 0.89,但零填充掩码评估下骤降 0.24,而 LSTM、GRU 和 1D-CNN 保持稳定。在无泄漏分组评估中,随机森林最稳健,Transformer 的误报率从 0.04% 升至 2.7%,增加 67 倍。研究呼吁采用无泄漏分割、明确 padding 披露和序列感知基准测试作为标准实践。论文入侵检测Transformer时序评估推荐理由:这篇论文戳破了 Transformer 在入侵检测中“近乎完美”的假象——做网络安全 AI 研究的团队,尤其是依赖 CIC-IDS2017 基准的,建议仔细看 padding 和分割协议的影响,否则你的模型评估可能虚高 0.24 macro-F1。原文稍后读已读值得跟进有用关注 入侵检测
20:29rohanpaul_ai@rohanpaul_ai一篇新论文发现 Transformer 的 Key 和 Value 投影可以共享同一映射,从而将 KV 缓存减少 50%,而困惑度仅上升 3.1%。最佳变体 Q-K=V 保留了 Query 的独立性,使注意力仍具有方向性。结合 GQA 和 MQA 时,缓存削减可达 87.5% 和 96.9%。弱变体 Q=K-V 因对称性不适合因果语言模型,且无缓存节省。该发现挑战了传统 QKV 三投影的必要性,对推理内存优化有重要意义。论文TransformerKV 缓存注意力机制推荐理由:做 LLM 推理优化的团队可以直接参考这个设计——砍掉一半 KV 缓存但几乎不损质量,值得在自家模型上试试。原文稍后读已读值得跟进有用关注 Transformer
12:12官方账号arXiv cs.LG@Chenxiao Yang, Nathan Srebro, Zhiyuan Li精选该论文严格刻画了深度L、总参数W的Transformer的VC维,上界为O(L W log(T W)),下界为Ω(L W log(T W / L)),其中T为输入序列长度。进一步,论文给出了思维链学习(chain-of-thought)的样本复杂度紧界:教师强制(teacher forcing)方法需要O(L W log((T+T')W))个样本,而任何利用思维链数据的学习规则至少需要Ω(L W log((T+T')W / L))个样本,T'为自回归步数。这些结果首次为Transformer的泛化能力提供了理论保证,对理解大模型的数据效率有重要意义。论文TransformerVC维样本复杂度推荐理由:理论研究者终于有了Transformer样本复杂度的紧界——VC维和思维链学习的下界都算清楚了,做深度学习理论的团队值得细读。原文稍后读已读值得跟进有用关注 Transformer
01:03Gary Marcus@GaryMarcus精选Gary Marcus 在 X 上反驳 Google 联合创始人 Sergey Brin 的观点,Brin 认为 Transformer 架构本身足以实现 AGI。Marcus 指出,当前没有任何团队单独使用 Transformer,而是结合工具、约束和神经符号 AI 架构。他认为 Transformer 可能是 AGI 的必要条件,但绝非充分条件,这正是神经符号 AI 兴起的原因。行业AGITransformer神经符号 AI推荐理由:AGI 路线争论升级,做 AI 架构和研究的开发者值得关注——Transformer 的边界在哪、神经符号 AI 为何崛起,看完会有启发。原文稍后读已读值得跟进有用关注 AGI
10:47Viking@vikingmute精选一篇名为《How LLMs Actually Work》的文章近日登上 HackerNews 榜首。文章用直观的例子和恰当的比喻,向有编程基础但未深入学 Transformer 的读者解释大模型工作原理。作者强调写作乐趣,坚持不用 AI 辅助,文章风格自然,没有 AI 味。适合想理解 LLM 底层逻辑的开发者阅读。论文LLMTransformer深度学习推荐理由:想搞懂 LLM 原理但被 Transformer 劝退的开发者,这篇用活人语言讲清楚了,比看论文轻松太多,建议直接点开。原文稍后读已读值得跟进有用关注 LLM
10:35官方账号arXiv cs.LG@Simon Schug该研究提出了一种名为Sgatlin(稀疏门控线性神经元)的新型网络结构,通过将每个专家缩小为单个神经元并移除非线性激活函数,在保持稀疏性的同时提升了计算效率。在等计算量对比中,用Sgatlin替换Transformer的前馈层可改善语言模型的困惑度。此外,稀疏性和线性结构使得模型更易解释,无需额外训练即可分析前馈电路,发现其形成语义聚类并参与事实回忆。这项工作为构建计算高效且可解释的Transformer前馈层提供了新思路。论文稀疏门控线性专家Transformer推荐理由:这项研究用极简设计同时提升了Transformer的计算效率和可解释性,做模型压缩或可解释性研究的团队值得关注,尤其是对MoE稀疏化方向感兴趣的开发者可以看看。原文稍后读已读值得跟进有用关注 稀疏门控
22:09官方账号Decoder@Tomislav Bezmalinović精选日本 AI 初创公司 Sakana AI 宣布成立专门研究递归自改进(RSI)的实验室,目标是让 AI 能够迭代地自我提升。该公司由 Transformer 论文合著者 Llion Jones 联合创立,认为 RSI 是大型美国实验室之间算力军备竞赛的替代方案。Anthropic 则警告这种技术存在控制风险。Sakana AI 的实验室将专注于开发能够自主改进自身代码和架构的 AI 系统,从而减少对大规模计算资源的依赖。这一方向可能改变 AI 发展的范式,从“堆算力”转向“用智能提升智能”。AI产品递归自改进Sakana AI算力军备竞赛10 个信源在谈事件专题推荐理由:Sakana AI 的递归自改进路线为算力受限的团队提供了新思路——用算法效率替代硬件堆叠,做 AI 研究的开发者值得关注这个方向。原文稍后读已读值得跟进有用关注 递归自改进
10:57官方账号arXiv cs.AI@Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi精选研究团队提出 Humanoid-GPT,一种基于 GPT 风格的因果注意力 Transformer,在 20 亿帧的运动数据上预训练,用于全身控制。与以往受限于数据稀缺和敏捷性-泛化权衡的浅层 MLP 追踪器不同,Humanoid-GPT 统一了所有主要动作捕捉数据集和大量内部录制数据。通过扩展数据和模型容量,该模型能够追踪高度动态的行为,并在未见过的动作和控制任务上实现前所未有的零样本泛化。实验表明,Humanoid-GPT 在零样本泛化和动态复杂运动追踪方面均达到了新的性能水平。论文Humanoid-GPT运动追踪零样本泛化推荐理由:做机器人全身控制和运动追踪的团队终于有了一个能零样本泛化的基础模型——Humanoid-GPT 用 20 亿帧数据训练,直接解决了以往模型在动态场景下泛化差的问题,做仿人机器人或动画生成的开发者值得关注。原文稍后读已读值得跟进有用关注 Humanoid-GPT
10:59官方一手marktechpost@Sana Hassan精选本文介绍了如何通过NVIDIA Apex库中的FusedAdam优化器和FusedLayerNorm层,结合PyTorch原生的torch.amp混合精度训练,来加速Transformer模型的训练。作者从源码编译Apex,检测融合内核是否可用,并进行了基准测试。实验表明,这些优化可以显著提升训练速度,同时保持模型精度。对于需要高效训练Transformer的开发者,这是一份实用的性能优化指南。技巧TransformerNVIDIA Apex混合精度训练推荐理由:Transformer训练慢是很多开发者的痛点,这篇教程直接给出了用Apex和torch.amp加速的具体步骤和基准测试结果,做NLP或大模型训练的团队可以照着优化自己的代码。原文稍后读已读值得跟进有用关注 Transformer
10:10Gary Marcus@GaryMarcus精选Gary Marcus 转发了一条关于神经符号系统(Neurosymbolic)的突破性进展:通过让一个 80 万参数的 Transformer 像逻辑求解器一样推理,仅用 15 分钟训练计算就能在极难数独(sudoku-extreme)上达到 100% 准确率。这项工作由 Leo 在 Axiom Math AI 完成,标志着神经符号集成在推理任务上的重大进步。它展示了小模型通过符号化推理能力可以超越纯神经网络方法,为 AI 推理效率提供了新思路。论文神经符号系统推理模型Transformer推荐理由:神经符号系统终于有了可量化的突破——小模型+符号推理就能碾压纯神经网络,做推理模型和逻辑 AI 的团队值得关注这个方向。原文稍后读已读值得跟进有用关注 神经符号系统
09:40官方账号arXiv cs.AI@Gyojin Han, Junmo Kim本文提出一种新架构用于文本驱动的3D人体动作编辑,核心创新在于不仅关注编辑发生的时间点,还识别哪些关节需要修改。架构包含两个轴锚定Transformer,分别提取关节和时间维度的特征,并通过跨轴融合块整合。辅助任务让关节锚定Transformer回归源与目标关节旋转的Soft-DTW距离,学习哪些关节应修改或保留。在MotionFix数据集上达到最先进效果,显著提升语义对齐和动作保真度。论文3D人体动作编辑文本驱动Transformer推荐理由:做3D动作生成或编辑的研究者可以关注,它解决了现有模型只关注时间编辑而忽略关节级修改的问题,直接提升编辑精度和语义一致性。原文稍后读已读值得跟进有用关注 3D人体动作编辑
10:28官方账号arXiv cs.LG@Brady Exoo, Alberto Bietti, John Sous这篇论文通过变量赋值和模加法任务,研究了 Transformer 如何实现组合泛化。作者将训练数据划分为不相交集合,发现小型 Transformer 能泛化到未见过的变量与数字组合。机制分析显示,无论输入是直接给出还是通过变量赋值间接给出,模型都使用相同的“模加法”MLP 模块。训练动力学分析揭示了三个阶段:先学习模加法,再学习变量赋值结构,最后精炼阶段泛化到困难序列。理论框架解释了组合性如何从训练动力学中自然涌现。论文Transformer组合泛化机制分析推荐理由:这篇论文用简洁的实验揭示了 Transformer 组合泛化的内部机制,对理解大模型如何组合技能有启发意义,做可解释性或模型架构研究的读者值得一看。原文稍后读已读值得跟进有用关注 Transformer
10:25官方账号arXiv cs.LG@Arnas Uselis, Darina Koishigarina, Seong Joon Oh精选人类能轻松将颜色与形状绑定(如“红色圆形”),但 CLIP 等视觉-语言嵌入模型在多物体场景中无法正确绑定概念,表现为“词袋”行为。研究发现,CLIP 的场景嵌入可加性分解为物体表征,但绑定函数复杂度高,导致图像与文本编码器无法学习共享的绑定机制,难以泛化到未见过的概念组合。通过从头训练的受控 Transformer 模型,作者发现当数据覆盖足够时,模型能学会低复杂度的绑定函数(涉及概念间的乘法交互),实现系统性泛化。该工作揭示了嵌入模型在概念绑定上的根本限制与突破条件,代码已开源。论文嵌入模型概念绑定CLIP推荐理由:做多模态嵌入或视觉-语言模型研究的开发者,这篇论文点出了 CLIP 类模型在概念绑定上的核心瓶颈,并给出了可复现的解决方案,值得深入阅读。原文稍后读已读值得跟进有用关注 嵌入模型
10:18官方账号arXiv cs.LG@Ulrich Prestel, Stefan Andreas Baumann, Nick Stracke, Björn Ommer精选RayDer 提出了一种统一的、前馈式 Transformer 架构,将相机估计、场景重建和渲染整合到一个主干网络中,将自监督新视角合成(NVS)转化为一个定义良好的单模型缩放问题。通过引入最小动态状态作为干扰因素,它吸收了视频中的时变内容,从而能够在无约束的真实世界视频上稳定训练。RayDer 将静态场景 NVS 作为目标任务,动态内容仅作为可扩展的监督信号,而非像动态场景(4D)NVS 那样进行重建。实验表明,RayDer 在数据和计算量上表现出清晰的幂律缩放行为,并在多个基准测试中取得了与有监督方法相媲美的零样本开放集性能。论文新视角合成自监督学习Transformer推荐理由:RayDer 解决了自监督 NVS 难以规模化的问题,做 3D 视觉和场景重建的研究者可以关注其简洁的缩放规律和零样本能力,值得在真实视频数据上试试。原文稍后读已读值得跟进有用关注 新视角合成