9月2日
10:07
9月1日
09:20
09:20官方账号arXiv cs.LG@Yuqi Pan, Zheng Li, Bohao Tang, Zhen Qin, Guoqi Li
精选73°
LoGo是一种新型注意力机制,解决了长上下文场景下的计算瓶颈问题。该模型通过动态分配注意力预算,为每个token选择局部或全局注意力。实验显示,LoGo在保持全注意力Transformer扩展性的同时,在长距离检索任务上表现优于静态混合模型。
推荐理由:LoGo让模型智能决定哪些token需要全局注意力,大幅提升长文本处理效率,比传统Transformer更聪明。
8月26日
22:54
11:01
11:01官方账号arXiv cs.AI@Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping
RACE(残差对齐一致性估计)是一种前向传递的统计框架,用于评估Transformer神经元在域范围内的功能一致性。实验表明,RACE在域特异性方面优于基于梯度的点估计,且计算开销比梯度方法低两个数量级。
推荐理由:RACE模型评估LLM神经元功能一致性,计算效率高,值得了解。
7月18日
19:33
19:33官方一手Sebastian Raschka: Ahead of AI@Sebastian Raschka, PhD
文章介绍了大型语言模型通过训练学习低、中、高三种推理模式的方法。低努力模式快速输出简短回答,中努力模式进行适度推导,高努力模式则执行逐步推理。这种技术允许用户根据任务需求和计算预算灵活调整模型的推理深度。

推荐理由:想省算力又不想牺牲推理质量?这篇技术分享教你LLM如何按需切换推理模式。
6月18日
10:43
10:43官方账号arXiv cs.AI@Depen Morwani, Alexandru Meterez, Pranav Nair, Sham Kakade
精选
该论文研究了随机重球法(HB)和加速SGD(ASGD)在一致线性回归中的计算效率与串行运行时间权衡。结果表明HB在任意谱下无法超越SGD的计算效率前沿,但允许在比SGD临界批量大sqrtκ倍的窗口内减少串行运行时间。ASGD在快速衰减幂律谱下可提升小批量计算效率,但随着批量增大,牺牲效率换取更优串行时间。合成线性回归实验验证了这些定性规律。
推荐理由:这篇论文把HB和ASGD在批量大小上的效率权衡讲清楚了,特别是那个sqrtκ倍的窗口,对想用动量方法加速训练的人很有参考价值。
6月12日
09:44
09:44官方一手arXiv: DeepSeek@Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian, Qiyuan Xu, Haonan Li, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia
精选73°
Pythagoras-Prover 是一个计算高效的 Lean 定理证明器系列,包含 4B 和 32B 参数的自回归模型,以及首个基于扩散的证明器(4B)。通过课程式监督微调和动态证明过滤,训练效率大幅提升。其 4B 模型在 MiniF2F-Test 上以 86.1% 的 pass@32 超越 DeepSeek-Prover-V2-671B(82.4%),参数减少约 167 倍;32B 模型达到 93.0%,创下开源新纪录。团队还提出了增强型 Lean 形式化方法(ALF),通过扰动已知问题生成变体,减少对表面形式的依赖,并发布了 MiniF2F-ALF 基准。
推荐理由:形式化证明领域终于有了计算高效的实用方案——4B 模型就能超越 671B 巨无霸,做定理证明或形式化验证的团队可以直接用,省下大量算力成本。