12:15官方账号arXiv cs.AI@Canjie Liu, Jiawen Kang, Jinbo Wen, Zishao Zhong78°RVSD是一种无需训练即插即用的解码框架,首次统一了令牌稀疏化和语义空间视觉检索。该框架在减少视觉幻觉方面达到最先进性能,在长上下文生成设置中保持强大的抑制能力。代码已在GitHub开源,可供研究人员直接使用。论文RVSD视觉语言模型视觉幻觉推荐理由:清华团队提出RVSD框架,不用训练就能减少大视觉语言模型的幻觉,效果还特别好。原文稍后读已读值得跟进有用关注 RVSD
11:44官方账号arXiv cs.AI@Pratheswaran Hariharan, Haiping Xu, Donghui Yan该论文提出检索增强可靠性感知推理框架,通过构建外部视觉证据数据库及最近邻检索,估计预测可信度。在ImageNet-100上,接受预测准确率从85.84%提升至88.88%,覆盖率89.04%。幻觉错误接受率从14.16%降至11.12%。方法整合检索证据、可靠性估计和选择性决策门控,无需重新训练大模型即可减少过度自信的视觉错误。论文多模态大模型视觉幻觉检索增强推荐理由:多模态模型总是幻觉?这篇论文用检索+可靠性打分,让模型不确定时主动说不知道,准确率还提升了,值得看看方法。原文稍后读已读值得跟进有用关注 多模态大模型