12:11官方账号arXiv cs.LG@Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang研究人员发现语言模型在对比偏好优化训练中会意外继承教师模型的谄媚行为。研究使用OLMo 3后训练流程,分析了三个模型家族的多对教师模型,发现教师模型谄媚率与学生模型谄媚率存在强相关性。这种意外转移不仅限于DPO,还发生在其他6种偏好优化目标中。研究显示谄媚信号分散在整个数据集中,而非集中在特定示例中。论文对比偏好优化谄媚行为OLMo推荐理由:OpenAI等公司常用偏好优化方法会意外传递谄媚行为,影响模型准确性。原文稍后读已读值得跟进有用关注 对比偏好优化
11:20官方账号arXiv cs.AI@Arthur Becker, Jakob Kemmler, David Thulke, Christine Schäfer, Christian Dugast, Hermann Ney该研究探讨了监督微调(SFT)中目标响应可能引发模型幻觉的问题。研究团队在Qwen 3 4B和OLMo 3 7B模型上测试了知识对齐SFT方法。实验显示,该方法在WildHalu和Biography基准上减少了事实性幻觉,同时保留了模型通用能力。Recall Rewrite方法在UnknownBench上表现出最强的拒绝行为改进。论文监督微调知识对齐Qwen 3推荐理由:这篇论文提出了两种新方法,能减少大模型幻觉,特别适合关注模型可靠性的研究者。原文稍后读已读值得跟进有用关注 监督微调
12:34官方账号arXiv cs.LG@Vatsal Venkatkrishna, Nico Daheim, Iryna GurevycharXiv新论文提出参数空间探索方法3PO(Perturbed Parameter Policy Optimization),通过从后验分布采样不同策略生成rollout,补充传统动作空间探索的不足。在OLMo-3-1025-7B和Qwen2.5-Math-7B上,3PO在数学推理和代码生成任务中平均性能优于标准GRPO,且FLOPs成本几乎相同。多参数采样还减少了训练中零优势组和错误rollout的数量。论文3POGRPO参数空间探索推荐理由:想提升LLM强化学习效果?3PO用参数采样替代温度调节,在OLMo和Qwen上比GRPO更稳更好,成本还一样。原文稍后读已读值得跟进有用关注 3PO
11:44官方账号arXiv cs.LG@Shreyas Subramanian, Adewale Akinfaderin, Akarsha Sehwag论文检验了LLM中“超级权重”(单参数移除后性能骤降)的存在性,发现这并非所有模型通用。在OLMo-1B和OLMo-7B上,单独训练100到8192个超级权重参数,精度降至随机猜测水平;即便扩展至周围36000个参数也无改善。相比之下,随机选取同层同等数量参数训练反而能提升基准。使用仅占0.16%参数的vanilla LoRA(更新注意力权重矩阵)成功微调,且施加于超级权重坐标的LoRA约束效果类似。结论指出参数重要性不等同于单独可训练性,有效微调需要基于全层的结构化分解。论文Super WeightLoRAOLMo推荐理由:这篇论文打脸了“超级权重”的主张:单独训练它们反而让模型崩成随机猜,而LoRA用极少的参数就能搞定。想了解模型微调真正该关注什么,必看。原文稍后读已读值得跟进有用关注 Super Weight
11:55官方账号arXiv cs.AI@Matteo Boglioni, Thibault Rousset, Siva Reddy, Marius Mosbach, Verna DankersLACUNA是首个具有参数级真实定位的遗忘测试床,通过掩码连续预训练将合成PII注入OLMo 1B和7B模型的预定义参数。评估发现现有SOTA遗忘方法在输出层面表现良好,但定位不精确,易受重新浮出攻击恢复已擦除知识。当遗忘精确定位相关参数时,简单梯度法也能实现强擦除并抵御重浮攻击。该测试床旨在补充行为评估,推动鲁棒遗忘方法发展。论文LACUNAOLMo遗忘学习推荐理由:想知道LLM遗忘是否真擦除了参数中的知识?LACUNA首次提供参数级验证,发现现有方法定位不准,容易复活。原文稍后读已读值得跟进有用关注 LACUNA
14:20官方账号AlphaSignal@AlphaSignalAI73°研究人员证明某些任务需要模型缩放而非数据缩放,小模型即使拥有无限数据也无法学会这些任务。原因在于神经元竞争:频繁任务优先抢占容量,稀有任务的梯度在下次更新前被覆盖,导致模型陷入学习后遗忘的循环。团队预训练了参数从4M到4B的OLMo模型,在训练中注入可控频率的新任务。只有最大的4B参数模型成功学会了稀有任务,干扰梯度几乎消失。论文OLMo模型缩放梯度推荐理由:这项研究用OLMo模型从4M到4B参数实验,直观解释了为什么小模型学不会稀有任务——不是数据不够,是神经元竞争导致梯度被覆盖。原文稍后读已读值得跟进有用关注 OLMo