论文Agent 与开发者10:22稀疏特征揭示视觉语言模型在有害表情包检测中的读出瓶颈这个研究挺有意思的,用稀疏特征的方法分析了Gemini和Qwen在检测有害表情包时的表现,发现模型内部其实有相关证据,但读出机制出了问题,这个发现挺有深度的。#Qwen#Gemini#有害内容检测#稀疏特征aarXiv cs.AI@Girish A. Koushik 等 3 人原文稍后读已读值得跟进有用关注 Qwen