09:59官方账号arXiv cs.AI@Kirill Labzin, Stepan Kulibaba, Artem Dzhalilov, Artem Gorokhov精选73°研究人员发现稀疏专家模型各层路由状态共享共同几何结构,通过广义正交Procrustes分析对齐后,单个线性转换可达到0.39-0.71的R²值,保留79-90%的预测能力。残差表示跨层更易预测,而路由控制状态更忠实保留模型专家选择。使用预测的规范状态替代原生路由状态,在OLMoE上降低ΔNLL 15.7%,在Phi上10个路由器范围内降低6.2%。论文稀疏专家模型MoE路由推荐理由:斯坦福团队揭示稀疏专家模型路由层间共享几何结构,能预测跨层路由行为,提升模型效率。原文稍后读已读值得跟进有用关注 稀疏专家模型
16:57官方账号arXiv cs.AI@Orion Reblitz-Richardson精选73°研究者在六个开源语言模型上训练了六个独立的线性探针,每个探针对应道德基础理论的一个类别。研究发现这些方向既不会坍缩为单一道德检测器,也不会相互隔离,而是跨越了接近最大数量的独立维度,同时共享一个正的共同成分。这种几何结构在不同架构和规模中保持一致,并在预训练早期就达到整合状态。在道德困境中,每个困境方向部分由其基础成分组成,但大部分方差编码冲突特定结构。论文道德基础理论语言模型MFT推荐理由:这篇论文揭示了语言模型如何以几何方式组织道德知识,发现模型能表示道德张力而非预判结果。原文稍后读已读值得跟进有用关注 道德基础理论
12:14官方账号arXiv cs.LG@Zixiang Xu, Sixian Li, Huaxing Liu, Xiang Wang, Shuai Li, Zirui Song, Xiuying Chen该论文从机制可解释性角度研究LLM作为评判者的评分偏见,覆盖7种评判模型、7种偏见类型和9个基准。研究发现偏见输入在隐藏状态中沿低维子空间位移,且该子空间在深层网络中更为显著。通过沿该子空间进行因果控制,可在清洁输入上复现偏见过打分,在偏见过输入上恢复基线打分。线性投影到偏见方向特征可预测模型在3个未见基准上的失败,效果远超基于文本的替代方法。论文LLM-as-Judge偏见机制可解释性推荐理由:这篇论文用几何视角解释LLM评判偏见,发现偏见隐藏状态的低维子空间,还能预测模型在未知基准上的失败,挺有意思。原文稍后读已读值得跟进有用关注 LLM-as-Judge
11:15官方账号arXiv cs.LG@Junhyoung Chung, Euijong Song, Won Hwa Kim, Gunwoong Park研究人员提出 Convex Distance Operator Transport (CDOT),这是首个凸最优传输框架,能在异构域之间对齐分布,同时保留特征对应和内在几何结构。CDOT 通过基于算子的正则化,引入距离和条件期望算子来对齐聚合距离结构,从而提升对局部几何变化的鲁棒性。理论证明 CDOT 差异是属性紧致度量-测度空间上的有效伪度量,并揭示了其与 Gromov-Wasserstein 的非凸性差异。实验在合成点云、脑连接组和图分类基准上表现优于现有方法,且行为稳定可靠。论文最优传输凸优化几何结构推荐理由:做分布对齐或几何数据处理的团队,CDOT 解决了传统 GW 非凸优化不稳定的痛点,可以直接用这个凸框架提升效果,建议点开看理论证明和实验对比。原文稍后读已读值得跟进有用关注 最优传输
21:35官方一手Anthropic: Transformer Circuits(资讯)Gurnee 等人 2025 年的研究揭示了语言模型在计数任务中背后的几何机制。他们发现模型内部存在一种流形结构,用于表示和操作数字信息。这项研究通过分析模型在特定任务中的内部表示,展示了模型如何通过几何变换来执行计数。这为理解语言模型的内部工作原理提供了新的视角,有助于开发更可解释的 AI 系统。论文语言模型几何结构计数任务推荐理由:对理解大模型内部机制的研究者来说,这篇论文揭示了计数任务背后的几何结构,值得深入阅读。原文稍后读已读值得跟进有用关注 语言模型