11:21官方账号arXiv cs.AI@Qiyao Yan, Chenpeng Wang, Liangming Pan精选73°研究人员发现大语言模型在推理任务失败时,可能并非缺乏底层能力,而是输出阶段存在瓶颈。通过隐藏状态探测,即使在序列评分完全崩溃的情况下,仍能解码出正确答案。使用最小化无标签校正协议,仅用25个未标记样本和2个参数,就能为Qwen3.5模型恢复9-34个准确点,该方法成功迁移到OLMo-2-1B和Llama-3.1-8B模型。论文Qwen3.5Llama-3.1-8BOLMo-2-1B推荐理由:发现大模型推理失败不等于能力缺失,用简单方法就能恢复被掩盖的内部逻辑。原文稍后读已读值得跟进有用关注 Qwen3.5
11:38官方账号arXiv cs.LG@Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato该研究采用Fluent Dreaming/EPO方法(结合GCG token优化和自交叉熵流畅性正则化)在Llama-3.2-3B和Llama-3.1-8B上抑制评估感知潜变量,实现了z≈-7的抑制幅度。发现基于CAA方向的抑制效果与随机方向无异,且在真实评估上下文中抑制该方向无法降低模型的行为评估判断。单个MLP神经元与评估相关但不具因果性。扫描真实Pile数据得到的自然文本基线可与优化器竞争。阳性控制验证了擦除检测器的有效性,解决了此前擦除与旋转的遗留问题。论文Llama-3.2-3BLlama-3.1-8BCAA推荐理由:这篇论文用实验告诉你:看似能隐藏模型“知道自己在被测试”的输入优化,可能是假象——抑制CAA方向跟抑制随机方向没什么两样。原文稍后读已读值得跟进有用关注 Llama-3.2-3B
09:47官方一手arXiv: DeepSeek@ Yonghui, Huang, Lin Ma, Amjed Tahir, Qian Zhang, Liwen Xiao, Lysa Xiao研究发现,在对六个LLM模型(包括DeepSeek-V3、Llama-3.1-8B等)进行26,016次多轮编程测试中,40%至73%的任务在8轮对话中丢失了之前正确的行为。论文构建了542个基于HumanEval+和MBPP+的任务,并扩展为8轮需求演化链。手动分析384个失败案例后,确定了跨轮冲突是主要失效模式。Verification Gate策略(对先前测试进行新代码验证并回滚重试)能将DeepSeek-V3的最终轮质量从75.8%提升至87.9%,Llama-3.1-8B从31.6%提升至47.3%。论文LLM编程助手回归累积推荐理由:这篇论文揭示了多轮编程时模型容易忘掉之前写对的东西,甚至四成以上任务会翻车。他们发现一个验证门控策略能显著改善,值得做AI编程工具的人看看。原文稍后读已读值得跟进有用关注 LLM
11:55官方一手arXiv: DeepSeek@Zaifu Zhan, Shuang Zhou, Rui Zhang提出一种多智能体互审推理方法,让多个LLM独立生成链式推理与候选答案,再互相评审事实正确性与逻辑合理性,选择最高分推理链输出最终答案。在Llama-3.1-8B、Qwen2.5-7B、Phi-4、DeepSeek-LLM-7B、GPT-oss-20B五个模型上对HeadQA、MedQA-USMLE、PubMedQA三个基准测试,平均准确率达0.820,超过单模型最佳0.777和多数投票集成最高0.789。评审可靠性高,能有效区分优质与低质推理链。论文Llama-3.1-8BQwen2.5-7BPhi-4推荐理由:这篇论文让多个AI模型互相评审对方的思考过程,医学问答准确率比单模型高5个百分点,比投票集成也高3个百分点,有意思。原文稍后读已读值得跟进有用关注 Llama-3.1-8B
10:31官方账号arXiv cs.LG@Gabriel Garcia精选这篇论文发现,判断Transformer层是否“等价”时,常用的替换测试和交换测试会给出截然不同的结论。替换测试看一层能否替代另一层的位置,交换测试看两层互换后输出是否近似。在Pythia、Qwen3-8B和Llama-3.1-8B等模型上,两种测试的差距从训练初期到收敛逐渐扩大。例如Qwen3-8B在8B规模下,交换测试指导的剪枝比替换测试安全数倍,而Llama-3.1-8B两种测试的剪枝成本却相近。这意味着研究者不能只依赖单一指标判断层冗余,否则可能误判哪些层可以安全剪枝或合并。论文模型压缩层等价性剪枝推荐理由:做模型压缩或剪枝的团队,如果只用一种等价性测试就决定删层,可能会踩坑——这篇论文用Qwen3-8B和Llama-3.1-8B的对比告诉你,测试方法选错,安全剪枝的层数能差好几倍。建议在剪枝前先跑一下两种swap-KL诊断。原文稍后读已读值得跟进有用关注 模型压缩