10:03官方账号arXiv cs.AI@Haadia Amjad, Ronald Tetzlaff该论文研究了概念可解释AI(CXAI)在多标签分类任务中的适用性,使用VGG16和ResNet50在MS-COCO数据集中标注最多的20个标签上训练模型。作者应用CRP和CRAFT两种CXAI方法生成概念级解释,发现CXAI能揭示DNN的学习弱点、更高概念区分度可减少标签与概念混淆、环境概念暴露数据集偏差。结果表明CXAI有助于诊断数据集引发的偏见并理解模型泛化能力。论文CXAI多标签分类MS-COCO推荐理由:这篇论文用VGG16和ResNet50跑MS-COCO,实测CRP和CRAFT两种解释方法,发现概念混淆和数据集偏见的具体规律,做可解释性研究值得看看。原文稍后读已读值得跟进有用关注 CXAI
09:29官方账号arXiv cs.AI@Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong HeCRAFT是一种新方法,将基于评分标准的评估数据集转化为模型特定弱能力诊断。它从每个提示-评分标准对中提取能力描述,聚类成层次能力树,在4个开源模型、金融和法律两个领域及13个保留基准上评估。在金融领域,CRAFT对所有4个模型的平均分超过基线;在法律领域,对4个模型中的3个表现最强。结果表明,基于评分标准诊断比基于提示或类别能更精确地定位模型弱能力,并生成更有效的微调数据。论文CRAFT微调能力诊断推荐理由:CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。原文稍后读已读值得跟进有用关注 CRAFT