12:22官方账号arXiv cs.AI@Hiskias Dingeto论文指出自然语言自编码器通过重构分数评估解释的忠实性存在缺陷:在Qwen-2.5-7B的口语化器上,约2%的特定主张与重构相关,分数主要反映大意而非具体事实。在合成真值下,标准方法在5/5次运行中产生了共适应私有代码(重构依赖的虚假措辞)。提出两个审计协议(grounded-vs-true交叉和评估器交换)以及RECAP(通过协训练辅助预测器使指定内容可解码)。在RECAP训练的沙盒模型上,新口语化器真实陈述指定内容,代码消失,代价仅+0.001 nat。在预训练的Pythia-160M上,指定内容变得可探针解码,虽新口语化器仅部分传达(真值0.44-0.46 vs 近零对照)。独立探针对口语化器的真实主张评分高于虚假(AUC 0.96 vs 无RECAP 0.82),对抗攻击下RECAP探针仍能识别谎言(AUC 0.95),对照探针降至0.51。论文Qwen-2.5-7BPythia-160M可解释性推荐理由:这篇论文揭露了AI解释性评估的漏洞,并给出了RECAP方法,让你知道如何让模型内部信息真正可验证,而非被花言巧语欺骗。原文稍后读已读值得跟进有用关注 Qwen-2.5-7B
12:12官方账号arXiv cs.AI@Kai Ruan, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun该论文利用LLM Agent每轮隐藏状态的探针(probe),在任务早期预测最终失败。在TextCraft基准上,Recall-Controlled Probe Cascade以90%召回率目标为Qwen-2.5-7B节省47.1%推理计算,为Llama-3.2-3B节省37.2%。相比仅基于行为的方法,节省量高出1.6-1.7倍。论文还推导了保证高召回率所需的样本复杂度。论文LLM AgentQwen-2.5-7BLlama-3.2-3B推荐理由:这篇论文告诉你如何从模型内部状态提前看出agent会失败,比看外部行为省算力多了,实测省三到四成。原文稍后读已读值得跟进有用关注 LLM Agent