09:55官方账号arXiv cs.AI@Jia-Hao Ji, Sijie Li, Jiabei Cheng, Zixi She, Jin-Tai Yu, Zhiyuan Yuan研究多智能体系统中候选供应和答案选择对LLM判断价值的影响,分析15,336个问题,发现正确答案常在候选中,但系统仍可能报告错误答案。通过结合答案频率和判断者的评估,将准确率从63.82%提升至70.82-70.95%,主要通过挽救被常见错误压倒的正确答案。论文多智能体系统LLM判断答案选择推荐理由:这篇论文分析了多智能体系统中LLM判断的价值,揭示了候选供应和答案选择的重要性,值得一读。原文稍后读已读值得跟进有用关注 多智能体系统
09:32官方账号arXiv cs.AI@Xinkang Li, Rong Jiang, Xin Song, Ye Wang, Yue Han, Changjian LiSTEC提出证据压缩框架,解决开放域多跳问答中多条搜索轨迹带来的最终答案选择困难。框架通过答案级证据压缩将轨迹按答案分组并转换为候选特定证据表示,再通过证据引导答案验证比较这些表示并选出最终答案。在四个多跳问答基准(如HotpotQA、2WikiMultihopQA等)上,STEC总体表现优于现有方法。消融实验证实答案级证据压缩对选择效果有显著贡献。论文STEC多跳问答证据压缩推荐理由:多跳问答里选答案总是被多条轨迹搞晕?STEC用证据压缩把问题简化为候选级比较,四个基准上全面领先,值得读。原文稍后读已读值得跟进有用关注 STEC