12:14官方账号arXiv cs.AI@Urja Pawar, Rajitha Ramanayake, Owen O'Neill, Nabeel Kemal, Abhishek Mandal, Houssem Chatbri, Christopher Martin精选73°研究人员提出两种互补信号检测黑盒大模型幻觉:语义熵和token不确定性。他们开发了TopK方法聚合token信号,CoCoA方法结合目标响应不确定性和语义相似性,以及Gated和Stacked两种监督方法。研究在7个基准上测试了4个语言模型,Stacked方法在近半数情况下表现最佳,TopK和CoCoA无需监督标签也具竞争力。论文LLMs幻觉检测语义熵推荐理由:这篇论文教你如何检测黑盒大模型的幻觉,有4种方法可选,无需监督标签也能用。原文稍后读已读值得跟进有用关注 LLMs
09:32官方账号arXiv cs.AI@Hefan Zhang, Bingquan Zhang, Ming Cheng, Saeed Hassanpour, Weicheng Ma, Soroush Vosoughi精选研究分析了8个分类任务、2个生成任务和30个模型的语言自信与内部自信差异。分类任务中,语言自信与基于logits的自信在关联性、幅度一致性和校准性三个维度上经常不一致。生成任务中,语言自信无法有效跟踪基于语义熵的不确定性。指令微调模型通常报告更高自信,但自信差距更大且校准更差。论文大语言模型置信度校准推荐理由:8个分类任务+30个模型研究显示,LLM说的自信程度和实际内部自信经常不一致原文稍后读已读值得跟进有用关注 大语言模型
17:41官方账号arXiv cs.AI@Minsoo Kim, Sungyoung Ji, Kisung Moon, Ilyong YoonASMI是一种免训练的估计器,通过掩码注意力头并测量子网络间的BALD互信息来检测模型对token预测的不确定性。在接地问答任务中,ASMI在单次置信度和熵之外增加了错误预测信息,可将置信过滤器的保留错误减半。在12个接地基准设置中,Sem-ASMI在10个上追平或超越语义熵基线,最佳ASMI变体在8个中领先。在参数化问答中,所有变体回归到零成本MSP基线,符合预期。论文ASMI不确定性估计注意力机制推荐理由:这篇论文提出了一种不用训练就能测模型不确定性的新方法,在接地问答上比现有基线更准,还能自己判断什么时候适用。原文稍后读已读值得跟进有用关注 ASMI
13:02官方账号arXiv cs.AI@Shizhe Lin, Ladan Tahvildari多智能体代码生成系统常因LLM幻觉和错误传播而可靠性不足。现有语义熵方法虽能量化不确定性,但依赖昂贵的LLM等价性检查。新提出的FASE指标通过结构/语义差异图的最小生成树近似功能正确性,无需LLM参与。在HumanEval和BigCodeBench上,FASE相比传统语义熵在Spearman相关性上平均提升25%,ROCAUC提升19%,而计算成本仅为传统方法的0.3%。这使得FASE成为多智能体工作流中实用且经济的质量评估方案。论文代码质量语义熵多智能体推荐理由:多智能体代码生成团队终于有了低成本的质量评估工具——FASE用0.3%的计算成本实现更优的代码正确性预测,做自动化软件开发的工程师可以直接集成到工作流中。原文稍后读已读值得跟进有用关注 代码质量