10:17官方账号arXiv cs.AI@Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy精选73°研究人员提出BiG-SURE,一种基于跨温度语义一致性的不确定性估计方法。该方法通过构建锚点-探针二分图,使用NLI蕴含分数计算置信度。在文本QA、多语言QA和多模态QA任务中,BiG-SURE在黑盒模型设置下提升了平均弃权AUROC。论文BiG-SURELLMsVLMs推荐理由:BiG-SURE能帮你评估黑盒大模型的不确定性,无需访问模型参数,简单实用。原文稍后读已读值得跟进有用关注 BiG-SURE
10:30官方账号arXiv cs.AI@Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar本文研究了是否可以通过训练VLMs直接在自然语言中进行推理来指导低级操作策略。引入了$R^3$,一种简单的后训练配方,将现成的VLMs转化为机器人推理器。它首先在专家生成的推理轨迹上对VLM进行中期训练,然后使用单步基于评分的强化学习从离线动作数据中改进推理器。与之前主要使用结构化轨迹作为辅助监督的机器人推理方法不同,$R^3$训练自由形式的语言推理,以产生测试时对动作的指导。在语言表格和模拟的双手购物包装两个控制测试平台上,$R^3$提高了对未见任务的探索和泛化能力,并在两个基准测试中显著优于仅基于指令的模仿学习基线。分析表明,自由形式的语言推理可以作为测试时计算机制来引导低级策略。项目页面可在https://robotic-reasoner.github.io/找到。论文R^3自然语言推理机器人推理推荐理由:这篇论文介绍了$R^3$,一种将VLMs转化为机器人推理器的方法,通过自由形式的语言推理来指导低级策略,值得一看。原文稍后读已读值得跟进有用关注 R^3
10:35Jerry Liu@jerryjliu0精选LlamaIndex发布文档提取基准测试,评估了多种系统,包括VLMs和LlamaParse,覆盖370个企业文档和67种文档类型。CTO和联合创始人Simon Suo将进行技术讲解,探讨提取难度、现有基准测试的不足以及成本与准确性的权衡。论文LlamaIndex文档提取基准测试推荐理由:LlamaIndex发布文档提取基准测试,全面评估多种系统,了解提取难度和成本与准确性的权衡,不容错过!原文稍后读已读值得跟进有用关注 LlamaIndex
12:09官方账号arXiv cs.LG@Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang现有视觉语言模型(VLM)在处理3D任务时因缺乏空间理解而表现受限。研究者提出VLM-IE3D框架,通过从RGB视频中学习隐式几何令牌(IGTs)和显式几何令牌(EGTs),增强3D空间感知能力。该框架采用3D感知适配器融合两种几何表示与2D视觉信息,无需额外3D输入。在3D视频检测、3D视觉定位、3D密集描述和空间推理等任务上,VLM-IE3D均取得一致性优越性能。代码和模型已开源。论文VLM-IE3DVLMs3D感知推荐理由:这篇论文搞了个VLM-IE3D,让普通视觉语言模型看RGB视频就能学会3D空间感,不用额外3D设备,而且好几个3D任务都做得更好。原文稍后读已读值得跟进有用关注 VLM-IE3D