8月26日
11:27
11:27官方账号arXiv cs.AI@Md Saikat Islam Khan Bappy, Oshani Seneviratne
针对知识图谱问答中数据分散的问题,提出FedV-KGQA框架,结合本地图丰富化和知识图谱嵌入,确保原始三元组和关系参数不离开各个孤岛,实现结构化数据边界,无需集中式图访问。引入主题实体锚定机制,无需跨孤岛通信即可定位正确图邻域。在三个基准上评估12种模型配置,FedV-KGQA表现强劲,接近集中式性能,可泛化到3跳推理,对嵌入扰动具有鲁棒性。
推荐理由:FedV-KGQA框架解决了知识图谱问答中数据分散的问题,结合本地图丰富化和知识图谱嵌入,无需集中式图访问,引入主题实体锚定机制,无需跨孤岛通信即可定位正确图邻域,性能强劲,值得一看。
8月13日
17:49
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
精选
研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。
推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。