11:10官方账号arXiv cs.AI@Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas MuellerVIALS基准包含161个视觉解释任务,涵盖生物技术行业中实验工作流程中检查的各类视觉艺术品。尽管前沿视觉语言模型能够流畅描述自然图像,但它们无法准确解释这些科学图像,反映出在领域知识和特定领域视觉推理能力方面的局限性。相比之下,具有相关领域专业知识的科学家发现这些视觉解释任务很简单。无法类似解释这些图像的AI在专业生命科学工作流程中将具有有限的应用价值,因为这些艺术品是科学家推理、沟通和做决策的核心。论文VIALS视觉解释生命科学推荐理由:VIALS基准为视觉语言模型在生命科学领域的应用提供了新的评估标准,有助于识别模型在特定领域的局限性。原文稍后读已读值得跟进有用关注 VIALS
18:01官方账号arXiv cs.AI@AmirHossein Eshghi, Hamid Saadatfar, Seyyed Ali Hoseini, AmirMohsen Eshghi, Siavash Arjomand Bigdel该综述聚焦类激活映射(CAM)这一可解释视觉技术家族,梳理了自2016年首个CAM提出以来的57篇方法论文。文中按归因机制、架构依赖和评估目标构建分类体系,涵盖梯度法、无梯度评分、高分辨率上采样、弱监督定位、Transformer token归因以及基于CLIP、DINO、SAM的方法。综述指出研究趋势正从单层低分辨率类别分数解释转向多层、概率化、token感知和基础模型感知的比较式解释。评估协议仍碎片化,忠实度、定位、鲁棒性、计算成本和人类信任缺乏统一标准。论文CAM类激活映射可解释性推荐理由:想系统搞懂CAM方法演进,这篇57篇论文的综述把梯度法、Transformer归因、CLIP/DINO/SAM时代的新做法都梳理清楚了,还指出了各方法留下的坑。原文稍后读已读值得跟进有用关注 CAM