09:07官方账号arXiv cs.LG@Smitha Muthya Sudheendra, Jaideep Srivastava精选73°研究者在五个开源transformer模型中测试逻辑验证能力,使用有效-无效前提-声明对。尽管行为表现接近随机水平,逻辑有效性仍可从隐藏状态中完美解码。在保留模板、领域和推理家族条件下,有效性仍保持强可解码性。在行为不正确但评估条件明确的例子中,有效性仍高度可解码。论文transformer逻辑推理语言模型推荐理由:这篇论文揭示了语言模型内部逻辑表示与行为表达的分离现象,对理解LLM推理机制有重要价值。原文稍后读已读值得跟进有用关注 transformer
10:17官方账号arXiv cs.AI@Jie Liang, Zhengxin Yu, Hamid Nasiri, Peter Garraghan精选73°研究人员提出通过几何信号追踪LLM隐藏状态轨迹,包括时间曲率和方差斜率。在四项任务和三种底层模型上,这些信号能在任务完成前区分正确与错误推理路径。研究将每个任务分解为读、写、回应、转移四个动作链,发现不同信号能区分各种链模式。实验表明,该方法在τ-Bench上将任务成功率从24.1%提升至39.6%,同时减少11.2%的token消耗。论文LLM多轮推理隐藏状态推荐理由:这篇论文用几何方法追踪LLM推理轨迹,能提前发现错误路径,提升任务成功率还降低token成本。原文稍后读已读值得跟进有用关注 LLM
12:10官方账号arXiv cs.AI@Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini论文提出D-Score,一种基于隐藏激活矩阵奇异值分布的谱统计量,通过单次前向传播计算。在FAVA-Annotation和RAGTruth两个基准上评估,以特定层和容忍参数下奇异值接近最大值的数量作为幻觉分数。实验表明D-Score是强隐藏状态信号,无需外部验证器、检索步骤或多轮生成即可检测幻觉。该方法灵感源于模型处理与内部知识冲突的文本时,隐藏表示会沿额外奇异方向扩散。论文D-ScoreFAVA-AnnotationRAGTruth推荐理由:这篇论文给出一个简单检测幻觉的方法,只靠模型内部的隐藏状态算一个分数,不用外部工具,在FAVA和RAG上验证有效。原文稍后读已读值得跟进有用关注 D-Score
11:11官方账号arXiv cs.LG@Carlo Di Cicco该论文使用Qwen3-4B-Instruct模型在444个LiveCodeBench任务上研究代码正确性信号。首次尝试的代码正确性可从提示最终隐藏状态线性解码,无泄漏AUC为0.931±0.008。去除提示长度线性效应后AUC仍为0.911±0.010,高于基线0.754±0.014。在236个修复案例中,隐藏状态变化存在对比方向,但去除修复上下文协变量后不显著,表明其为修复上下文相关特征。论文Qwen3代码正确性隐藏状态推荐理由:论文揭示Qwen3隐藏状态如何预测代码正确性原文稍后读已读值得跟进有用关注 Qwen3