9月1日
10:17
10:17官方账号arXiv cs.AI@Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy
精选73°
研究人员提出BiG-SURE,一种基于跨温度语义一致性的不确定性估计方法。该方法通过构建锚点-探针二分图,使用NLI蕴含分数计算置信度。在文本QA、多语言QA和多模态QA任务中,BiG-SURE在黑盒模型设置下提升了平均弃权AUROC。
推荐理由:BiG-SURE能帮你评估黑盒大模型的不确定性,无需访问模型参数,简单实用。
8月26日
10:35
10:35Jerry Liu@jerryjliu0
精选
LlamaIndex发布文档提取基准测试,评估了多种系统,包括VLMs和LlamaParse,覆盖370个企业文档和67种文档类型。CTO和联合创始人Simon Suo将进行技术讲解,探讨提取难度、现有基准测试的不足以及成本与准确性的权衡。

推荐理由:LlamaIndex发布文档提取基准测试,全面评估多种系统,了解提取难度和成本与准确性的权衡,不容错过!
7月24日