10:59官方账号arXiv cs.AI@Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng本文提出Re$^3$Cap,一种基于检索引导的图像描述优化策略,通过强化学习提升图像描述准确性。该方法通过识别图像描述中的幻觉和遗漏,实现更精确的描述。在COCO-LN500基准测试中,Re$^3$Cap相较于GRPO平均提升了8.64%的相关推理性能。AI模型Re$^3$Cap图像描述强化学习推荐理由:Re$^3$Cap模型通过检索引导优化图像描述,比GRPO提升了8.64%的推理性能,值得一看。原文稍后读已读值得跟进有用关注 Re$^3$Cap
11:18官方账号arXiv cs.AI@Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz论文提出Symbal方法,利用现成基础模型通过双阶段结构检测多模态大模型生成图像描述时的系统性偏差。作者创建了SymbalBench基准,包含170万图像-文本对(自然图像和医学图像),组织成420个视觉语言数据集并标注了系统性偏差。Symbal在基准上正确识别63.8%数据集的偏差,比最强基线提升近4倍。实验还验证了Symbal能准确暴露4种多模态大模型生成描述中的错误,支持无需访问底层模型即可审计图像描述数据集。论文SymbalSymbalBench多模态大模型推荐理由:这篇论文提出了检测模型生成描述时系统性偏差的新方法和基准SymbalBench,比之前方法好用4倍,适合需要审计多模态模型输出的人。原文稍后读已读值得跟进有用关注 Symbal