9月1日
10:18
10:18官方账号arXiv cs.AI@Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee
精选73°
研究团队推出MIOH基准,系统评估多图像场景下的物体幻觉问题。该基准包含4项基础任务(存在性、计数、属性、位置),3种多图像推理模式(综合、比较、选择性)和3种对抗压力。测试显示GPT-5和Gemini-2.5-Pro等29个模型均存在不同失败模式。幻觉主要源于多图像间物体表示的整合阶段限制,而非感知失败。
推荐理由:MIOH基准帮你看清多模态模型在复杂视觉推理中的真实表现,GPT-5和Gemini-2.5-Pro也不例外。
8月27日
10:48
10:48官方账号arXiv cs.AI@Kaichen Li, Zhilin Zhu, Jianhao Huang, Zhengqin Lai, Baochen Xiong, Zibo Shao, Yaguang Song, Linhui Xiao, Xiaoshan Yang, Changsheng Xu
This paper introduces a new framework for Multimodal Unsupervised Continual Post-Training (MU-CPT), addressing the issue of visual dependence (VD) in MLLMs. The proposed Visual Dependence-Aware (VDA) framework uses Visually Constrained Optimal Transport (VC-OT) and Visually Modulated Adaptation (VMA) to enhance cross-modal learning and maintain task stability. Experiments validate the effectiveness of VDA in MU-CPT settings.
推荐理由:Read this if you're interested in the latest advancements in MU-CPT and how to improve cross-modal learning in MLLMs without supervision.
10:18
10:18官方账号arXiv cs.LG@Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai
SciMIF是一个新的基准,旨在评估多模态大型语言模型在遵循复杂科学指令方面的能力。通过分析5个代表性科学学科的22个不同任务,提出包含10个约束组的全面分类法。实验发现,不同科学学科间存在显著性能差异,化学对当前MLLMs更具挑战性。SciMIF填补了评估科学领域多模态指令遵循的空白,为MLLMs在严格科学应用中的未来改进奠定基础。数据与代码将在GitHub上发布。
推荐理由:SciMIF基准为评估MLLMs在科学领域的指令遵循能力提供了新工具,揭示了不同学科间的性能差异,对科学研究和MLLMs发展具有重要意义。
8月21日