9月3日
11:44
11:44官方账号arXiv cs.LG@Isaiah Andrews, Suproteem Sarkar
该研究评估了语言模型在概率预测方面的一致性。研究人员通过构建线性程序计算荷兰书利润,衡量模型预测的不一致性。研究发现语言模型预测存在显著不一致性,事件间逻辑关系越丰富,不一致性越高。无关上下文细节可使不一致性提高一个数量级。
推荐理由:荷兰书利润方法评估语言模型预测一致性,发现模型在概率预测上存在显著不一致,尤其在复杂逻辑关系下更明显。
09:07
8月26日
8月25日
10:51
10:51官方账号arXiv cs.AI@Na Li, Yuchen Jiao, Changxiao Cai, Gen Li
精选
ConvergeFlow 是一种基于嵌入空间的流语言模型,通过约束数据预测器到标记嵌入的凸包,并仅用流匹配引起的均方误差目标进行训练。实验表明,ConvergeFlow 在 OpenWebText 上的性能与现有连续和离散扩散语言模型相当。
推荐理由:Na-Li66团队发布了ConvergeFlow,这是一种基于嵌入空间的流语言模型,它通过改进训练方法,在性能上与现有模型相当,值得一试。
8月22日
15:43
08:34
8月19日
23:40
8月11日
11:16
11:16官方账号arXiv cs.AI@Nathan Godey, Yoav Artzi
精选
Matryoshka训练框架将500M、1.5B和3B三个子模型堆叠进单一嵌套架构,端到端训练。相比独立训练基线,该套件在基准性能和困惑度上持平,但训练计算量减少36%。嵌套结构天然支持投机解码,吞吐量提升14-26%。论文还消融了关键架构选择,为构建强Matryoshka套件提供指导。
推荐理由:想省训练算力又不想掉性能?这个嵌套训练法把三个模型塞一个架构里,直接省36%算力,还顺带加速推理,值得一看。
7月30日
7月17日
11:30
11:30官方账号arXiv cs.AI@Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo
该论文提出通过公共讨论界面(如论坛评论)向大语言模型预训练数据注入恶意内容的攻击方法。作者引入HalfLife分析工具,用于评估网络爬虫数据中是否包含对抗性内容。实验表明,基于维基百科等传统数据源的投毒假设不适用于真实的大规模异构预训练语料库。研究强调第三方网页内容可能成为攻击语言模型预训练的潜在向量。
推荐理由:这篇论文讲了一种真实的预训练数据投毒方式——通过论坛评论注入恶意内容,还给出了分析工具HalfLife,搞AI安全的值得看。
7月14日
19:54
19:54官方账号Decoder@Tomislav Bezmalinović
精选
Anthropic发布新研究,分析了Claude模型在不同语言中的价值表达。研究将数千个术语映射到四个核心维度。结果显示Claude在印地语中表现出更多温暖,在俄语中表现出更多严谨。这揭示了语言对AI回答的塑造作用,并提出了方法论问题。
事件专题

推荐理由:Anthropic发现Claude说印地语时更暖心,说俄语时更较真。有趣的研究,看看你的语言会影响AI怎么对你。
7月7日
03:26
03:26官方一手Anthropic: Transformer Circuits资讯
精选
研究者发现Claude模型内部存在一组可言语化的特权表征,这些表征形成全局工作空间。这些表征仅占模型内部状态的一小部分,但可用于报告、控制和推理。相比之下,模型的大部分处理是自动且不可言语化的。该研究揭示了语言模型内部计算的可解释性结构。
推荐理由:这篇文章发现了Claude模型内部有个‘大脑指挥部’——一小部分它能说出来的表征,其他都是自动在干。挺有意思的视角。
7月5日
6月16日
09:50
09:50官方账号arXiv cs.LG@Zongfang Liu, Jinghui Zhang, Zijian Ma, Guangyi Chen, Xin Yuan
该研究提出MoE专家一次性剪枝的统一公式,将现有启发式标准归为路由频率、门控权重、激活强度三类因素。基于此给出选择原则:任务无关剪枝应优先使用基于激活强度、无门控的标准。新提出的MAN和MSAN标准在4个MoE模型、16个基准上取得任务无关设置平均排名前两位。平均性能比最强基线提升最多8.8个百分点。
推荐理由:这篇论文把MoE剪枝的各种评分方法统一了,还提出MAN和MSAN两个新标准,在多个模型和基准上表现更稳定,适合做模型压缩的人参考。
6月2日