09:28官方一手arXiv: DeepSeek@Zhuo Xie, Haoze Ni精选论文提出多源证据共识验证框架MECV,用于修正AI生成新闻摘要中的幻觉。MECV聚合源文档、维基百科和开放网页检索三类异构证据,并引入多LLM陪审团机制,通过矛盾感知共识评分评估事实可靠性。在SummEdits基准上使用GPT-4o-mini和DeepSeek-Chat作为验证模型、Qwen-Plus作为编排器进行实验。结果显示MECV在保持摘要语义结构的同时提升了事实一致性,跨源共识可作为识别事实不确定性的有效信号。论文MECVSummEditsGPT-4o-mini推荐理由:这篇论文解决AI摘要瞎编的问题,用多源证据+多模型投票来纠错,在SummEdits上验证有效,做新闻聚合的可以看看。原文稍后读已读值得跟进有用关注 MECV
11:39官方账号arXiv cs.AI@Sangwoo Cho, Kushal Chawla, Pengshan Cai, Zefang Liu, Chenyang Zhu, Shi-Xiong Zhang, Sambit SahuBINEVAL将评估标准拆解为原子化的二元问题,由LLM独立回答后聚合为多维可解释分数。在SummEval、Topical-Chat和QAGS三个基准上,BINEVAL匹配或超越UniEval和G-Eval,尤其擅长事实一致性评估(QAGS上的表现突出)。其问题级反馈可用于迭代优化评估提示和生成提示,在IFBench的自我更新和跨模型更新设置中均有效。该方法无需训练、任务无关,且避免了现有LLM评判器的天花板效应。论文BINEVALLLM评估可解释性推荐理由:BINEVAL把LLM评估拆成一堆“是/否”问题,结果好理解、易调试,在事实一致性上比UniEval还准,还能自己优化提示词。原文稍后读已读值得跟进有用关注 BINEVAL