12:15官方账号arXiv cs.AI@Canjie Liu, Jiawen Kang, Jinbo Wen, Zishao Zhong78°RVSD是一种无需训练即插即用的解码框架,首次统一了令牌稀疏化和语义空间视觉检索。该框架在减少视觉幻觉方面达到最先进性能,在长上下文生成设置中保持强大的抑制能力。代码已在GitHub开源,可供研究人员直接使用。论文RVSD视觉语言模型视觉幻觉推荐理由:清华团队提出RVSD框架,不用训练就能减少大视觉语言模型的幻觉,效果还特别好。原文稍后读已读值得跟进有用关注 RVSD
10:12官方账号arXiv cs.LG@Matteo Merler, Giovanni Bonetta, Davide Zago, Rossella Cancelliere, Bernardo Magnini73°研究人员提出SAGE框架,通过熵值选择性查询视觉语言模型(VLM)教师。该框架在训练过程中仅在不确定时查询VLM,执行建议动作,并将指导提炼为轻量级强化学习策略。在稀疏奖励视觉推理和导航任务中,SAGE学习到的策略在评估时无需VLM指导,并在多个环境中优于无引导的强化学习。论文SAGEVLM强化学习推荐理由:SAGE框架让VLM只在关键时刻提供指导,大幅减少调用次数,学习到的策略甚至能超越VLM教师表现。原文稍后读已读值得跟进有用关注 SAGE
10:11官方账号arXiv cs.AI@Yinwen Lu, Weihao Luo, Yueqi Zhong73°GarmentWeaver是一种新型框架,通过激活服装相关结构分支构建紧凑层次化目标,从草图和文本描述中推断可执行缝纫模式。该模型基于预训练视觉语言模型构建,引入了感知可行性的正则化方法。实验表明,GarmentWeaver比基线方法生成更准确、更可执行的缝纫模式,同时获得更好的模拟结果。论文GarmentWeaver多模态服装设计推荐理由:GarmentWeaver能从草图和文本生成可执行缝纫模式,比现有方法更准确且兼容性好。原文稍后读已读值得跟进有用关注 GarmentWeaver
21:44官方一手marktechpost@Asif Razzaq精选Cohere推出Parse (parse-v5.0),这是一个23亿参数的视觉语言模型。该模型可将PDF、幻灯片和图像转换为包含HTML表格、边界框和图像描述的Markdown格式。Parse在ParseBench基准测试中得分为79.2,领先于Mistral OCR 4、Azure Document Intelligence和Databricks AI Parse。API定价为每1000页1.5美元,专用Model Vault实例起价为每月2500美元。AI产品CohereParse视觉语言模型推荐理由:Cohere新出的Parse 5能处理企业文档,比竞品在基准测试中表现更好,价格也透明。原文稍后读已读值得跟进有用关注 Cohere
20:05官方账号arXiv cs.AI@Junjie Liu, Shengyuan Ye, Xu Chen78°PACE框架通过统一压缩提取范式,在Qwen2.5-VL-7B模型上实现仅使用10%视觉 tokens 保持93.8%原始性能,时间到首个token提速3.1倍。该框架包含自适应像素压缩器(APC)和动态双注意力提取器(DDAE)两个核心组件。PACE无需训练即可同时优化视觉编码器和大型语言模型的推理过程。AI模型PACEQwen2.5-VL-7B视觉语言模型推荐理由:清华团队推出PACE框架,让Qwen2.5-VL-7B推理速度提升3.1倍,性能只损失6.2%原文稍后读已读值得跟进有用关注 PACE
19:04shao__meng@shao__meng78°Cohere 发布 Parse 5,这是一款 2.3B 参数的专用文档解析视觉语言模型。Parse 5 支持 PDF、PPT、JPEG 等格式,拥有 8192 上下文窗口。在 ParseBench 测试中,Parse 5 获得 79.2 分,超过 Mistral OCR 4(74.5)等竞争对手。该模型能将非结构化企业文档转换为结构化 Markdown 数据,支持表格、表单和图片处理。AI产品CohereParse 5文档解析推荐理由:Cohere 新出的 Parse 5 专门解析企业文档,比传统 OCR 更强,价格还低。原文稍后读已读值得跟进有用关注 Cohere
09:53官方账号arXiv cs.AI@Yuqiang Lin, Yan Shi, Sam Lockyer, Harish Tayyar Madabushi, Adrian Evans, Wenbin Li, Yinhai Wang, Nic ZhangTAU-Agent 是一种用于交通异常理解的代理检索增强框架,通过视频字幕工具和开放词汇跟踪工具检索相关证据,并使用视觉语言模型进行推理和答案生成。在 AI City Challenge 2026 的基准测试中,TAU-Agent 在三个任务中分别排名第二、第十二和第五。代码可在 GitHub 上获取。论文TAU-Agent交通异常理解视频字幕工具推荐理由:TAU-Agent 是一款用于交通异常理解的新框架,通过结合视频字幕和跟踪工具,实现了对交通视频的异常检测和解释,其在基准测试中的表现值得一看。原文稍后读已读值得跟进有用关注 TAU-Agent
10:55官方账号arXiv cs.AI@Md Thamed Bin Zaman Chowdhury, Moazzem Hossain针对低资源国家道路交通事故问题,提出EGD框架,将道路安全专家知识转化为视觉语言模型,实现可扩展的道路安全审计。BD-ARSA数据集包含21,947条图像审计记录,EG-ARSA模型在风险评估上优于其教师模型和Gemini-2.5-Flash模型。论文EG-ARSA道路安全审计视觉语言模型推荐理由:EG-ARSA模型基于专家知识,有效解决低资源环境下的道路安全审计问题,是Gemini-2.5-Flash模型的升级版。原文稍后读已读值得跟进有用关注 EG-ARSA
10:06官方账号arXiv cs.AI@Marek Hradil, Danae Sánchez Villegas视觉语言模型(VLMs)在视频和图像序列基准测试中表现出色,但它们是否捕捉到时间结构尚不清楚。我们提出时间定位作为异常检测问题,并引入TimeCatch,通过交换连续帧和用高斯噪声替换帧来创建时间异常和帧级异常。模型在四个合成和真实世界数据集上进行了异常检测和定位任务的评估,并与人类研究进行了比较。结果表明,VLMs在帧级异常检测中表现良好,但在时间异常检测中表现接近随机,在定位上仅略高于随机。人类在两项任务中都取得了接近天花板的表现。对模型规模、提示策略、序列长度和视觉相似度等方面的进一步分析表明,这些失败不能仅归因于感知或模型容量的限制。这些发现表明,当前的VLMs可以识别单个帧中的异常,但在整合跨帧信息以推理时间一致性方面存在困难。TimeCatch为评估视觉语言模型中的时间定位提供了一个受控的基准。论文视觉语言模型时间一致性异常检测推荐理由:这篇论文提出了TimeCatch,一个用于评估视觉语言模型时间一致性的基准,揭示了当前模型在时间异常检测上的不足,值得一读。原文稍后读已读值得跟进有用关注 视觉语言模型
11:10官方账号arXiv cs.AI@Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas MuellerVIALS基准包含161个视觉解释任务,涵盖生物技术行业中实验工作流程中检查的各类视觉艺术品。尽管前沿视觉语言模型能够流畅描述自然图像,但它们无法准确解释这些科学图像,反映出在领域知识和特定领域视觉推理能力方面的局限性。相比之下,具有相关领域专业知识的科学家发现这些视觉解释任务很简单。无法类似解释这些图像的AI在专业生命科学工作流程中将具有有限的应用价值,因为这些艺术品是科学家推理、沟通和做决策的核心。论文VIALS视觉解释生命科学推荐理由:VIALS基准为视觉语言模型在生命科学领域的应用提供了新的评估标准,有助于识别模型在特定领域的局限性。原文稍后读已读值得跟进有用关注 VIALS
09:52官方一手arXiv: DeepSeek@Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. LinteLGE心脏MRI在心房颤动患者中用于左心房纤维化评估和消融规划,图像质量对消融过程至关重要。本研究提出一种两阶段视觉语言模型(VLM)框架,用于左心房LGE-MRI的临床图像质量评估。第一阶段,微调的VLM生成结构化的放射学风格质量报告,预测五个放射科医生定义的标准:噪声、运动伪影、左心房边界准确性、肺静脉区域准确性和过度分割严重程度。第二阶段,基于GPT的推理模块将预测的质量和报告映射到结构化的质量评分和二进制临床可用性决策。使用60个标注的图像切片-文本对进行基准测试,InternVL2在标准级别上达到最高准确率(平均ACC=0.65,PLCC=0.79),DeepSeek在临床可用性上达到完美的一致性(准确率=1.00,kappa=1.00)。论文视觉语言模型图像质量评估心脏消融规划推荐理由:这篇论文提出了一种基于视觉语言模型的心脏消融规划LGE-MR图像质量评估方法,通过两个阶段的模型预测图像质量,有助于提高消融过程的安全性。与现有方法相比,InternVL2和DeepSeek在准确性和临床可用性方面表现出色。原文稍后读已读值得跟进有用关注 视觉语言模型
15:33官方账号arXiv cs.AI@Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Sixue Lin本研究提出密集同类属性错绑(DSCAM)问题,指视觉语言模型在拥挤场景中将属性错误分配给同类实例。作者发布InstaBind-Lite基准,含524张图像、529组3-6个同类实体、1773个框选实例及9580个确定性评估问题。测试5个开源和2个商业/API模型,开源系统平均错绑率19.84%,API系统7.55%,且80%以上错误源于相邻实例。该基准将错误答案分类为可识别来源,检验模型是否知道每个属性归属哪个实例。论文InstaBind-Lite视觉语言模型DSCAM推荐理由:想测多模态模型在拥挤场景里会不会张冠李戴?这个新基准InstaBind-Lite能精准量化,开源模型错绑率近20%,比想象中严重。原文稍后读已读值得跟进有用关注 InstaBind-Lite
00:05官方一手marktechpost@Asif RazzaqLiquid AI发布LFM2.5-VL-3B,一个3.1B参数的视觉语言模型,专为端侧部署设计。该模型在ScreenSpot-v2上平均得分80.7,在RefCOCO指代分割任务上从57.1提升至87.9。函数调用能力首次加入VL系列,ToolSandbox得分从26.4跃升至59.5。模型体积约3GB,在Apple M5 Max上解码速度达228 tokens/s。AI模型LFM2.5-VL-3BLiquid AI视觉语言模型推荐理由:Liquid AI把视觉语言模型塞进端侧,能读屏、指物、调工具,3GB体积在苹果芯片上跑得飞快。原文稍后读已读值得跟进有用关注 LFM2.5-VL-3B
18:08官方账号Cohere@cohere精选Cohere 今日推出 North Micro Vision,这是其最小的视觉语言模型,专为复杂文档理解设计。该模型以 Apache 2.0 许可证开源,权重已上传至 Hugging Face。相比 Cohere 其他模型,North Micro Vision 更轻量,适合在资源受限场景下处理视觉任务。开发者可直接从 Hugging Face 下载权重进行部署。AI模型CohereNorth Micro Vision视觉语言模型推荐理由:Cohere 出了个超小的视觉模型 North Micro Vision,专门用来读懂复杂文档,而且开源了,直接去 Hugging Face 就能下载权重。原文稍后读已读值得跟进有用关注 Cohere
11:36官方账号arXiv cs.AI@Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai JiangMedPixel是一个统一的医学像素-语言模型,通过共享的语言-掩码接口连接临床语言、视觉推理与像素级定位。研究团队构建了MedPLG-440K数据集,包含约44万个像素-语言任务样本,通过临床驱动的合成流程生成,无需外部LLM标注。模型采用联合多任务监督微调和像素级偏好优化训练,后者利用真实掩码作为离线验证器,从掩码质量推导响应偏好。MedPixel支持显式定位、隐式推理、空间交互、可解释分割和医学VQA等任务,在像素级预测和响应生成上均表现强劲,并具备对零样本外部基准和模糊空间提示的鲁棒性。论文MedPixel医学图像分割视觉语言模型推荐理由:医学图像分割和语言模型终于打通了,MedPixel一个模型搞定定位加问答,还自带44万样本的数据集,搞医学AI的值得看看。原文稍后读已读值得跟进有用关注 MedPixel
11:08官方账号arXiv cs.AI@Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury论文提出用视觉语言模型处理数值时间序列,将KPI窗口编码为2D图,在Llama-3.2-90B、Qwen2.5-VL-72B和Pixtral-12B上实现3.6-10.4倍输入token缩减。实测推理能耗降低1.8-2.5倍,在电信边缘部署中每天节省约7.2MJ。微调的Llama-3.2-90B-Vision异常检测精度比文本版高220.7%,比LSTM和ARIMA高144%。Pixtral-12B在公共基准上J/F1提升20.6倍,平均F1为0.82。论文Llama-3.2-90BQwen2.5-VL-72BPixtral-12B推荐理由:这篇论文告诉你,把数据画成图再给模型看,能省电还更准。电信场景实测能耗降2.5倍,精度翻倍,值得做时序分析的人看看。原文稍后读已读值得跟进有用关注 Llama-3.2-90B
09:21官方账号arXiv cs.AI@J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà这项研究通过输入消融测试,检查视觉语言模型(VLM)在零样本控制中是否真正依赖视觉输入。在9个直接控制模型、6个结构化局部VLM和1个VLM-MPC层级中,分析了32,874次评分调用。结果显示多数直接控制模型表现负面,常数SLOW策略甚至优于脚本几何控制器。图像仅确定性正对照以0.090米MAE和精确镜像等变性估算前车间距,证明视觉刺激信息充分。后验对称一致性守护者选出的模型在272帧上达到0.954平衡准确率,弃权时提升至0.973。论文VLM视觉语言模型具身智能推荐理由:这篇论文用消融实验戳穿了VLM做零样本控制的假象,多数模型其实没在看图像。还给出了一个能到0.973准确率的守护方案,想搞具身智能的值得看。原文稍后读已读值得跟进有用关注 VLM
11:41官方账号arXiv cs.AI@Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja GanuCARE-X 在生成骨干网络上增加焦损失分类与复合损失定位头,与语言建模目标联合训练,使胸片报告生成、发现分类和空间定位互相增强。配合任务级奖励优化的 DAPO 策略,该方法在四个报告生成基准的大部分指标上达到最优,ReXVQA 视觉问答准确率 94.0%,比次优基线高 6.0 个百分点。此外,将 Qwen3-VL-4B-Instruct 与可调用确定性测量工具的原生工具能力结合,在五个依赖测量的诊断场景中平均 F1 比仅靠感知的基线高 43.6 个百分点。论文CARE-XQwen3-VL胸片推荐理由:医学影像领域的小伙伴可以看看这篇,CARE-X 把胸片分类、定位、报告生成整合到一个模型里,还靠工具调用做解剖测量,临床实用性比纯生成模型强不少。原文稍后读已读值得跟进有用关注 CARE-X
11:23官方账号arXiv cs.LG@Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach该研究在13个模型(9个LLM和4个VLM)中系统评测了字母大小写对注意力分配的影响。实验发现,将目标信息改为交替大小写或大写,能显著集中文本注意力。但这种注意力集中并不提升下游准确率,在交替大小写的高熵场景下甚至会造成下降。推理模型的思考阶段会缓冲这类排版敏感性,而视觉语言模型则表现出部分迁移效应。研究将大小写视为无需模型访问或微调的零样本注意力引导机制。论文大小写注意力机制LLM推荐理由:这篇arXiv研究测了13个模型:把关键词大写能集中LLM注意力,但准确率不一定提高,交替大小写还会拖累成绩。原文稍后读已读值得跟进有用关注 大小写
09:30官方账号arXiv cs.AI@Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez该研究构建了包含1,600个人类编写的幻觉样本数据集,覆盖中、英、法、意四种语言,并同时收集了来自五个视觉语言模型的18,400个样本进行对比。所有样本采用细粒度的跨度级标注方案来标记幻觉。实验发现,人类编写的样本在标注一致性上更高,且便于控制数据集内容,同时与模型生成样本在分布上保持相似。这表明人类数据可以替代模型生成的幻觉基准,用于更稳定的模型幻觉评估。论文幻觉检测基准测试视觉语言模型推荐理由:这篇论文用1,600个人类写的幻觉样本对比了18,400个模型生成的样本,发现人类样本更稳定、更好控制,以后测幻觉不用老换模型了。原文稍后读已读值得跟进有用关注 幻觉检测
11:56官方账号arXiv cs.AI@Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi ZhuSceneActBench 是一个评估视觉语言模型(VLM)代理在3D场景中行动能力的基准,包含5个任务,覆盖210个源实例和520个任务案例。每个任务在统一的代理-环境循环中运行,使用任务特定的几何指标评估最终输出。在11个专有VLM配置上测试,总体得分范围为38.6到50.2,没有任何配置在所有任务上表现一致。论文分析了失败模式,指出当前模型在多对象3D场景中的行动能力仍有显著不足。论文SceneActBench3D场景视觉语言模型推荐理由:想测测视觉语言模型能不能真在3D空间里干活?SceneActBench给你5个任务、520个案例,开源又公平,看哪个模型分高。原文稍后读已读值得跟进有用关注 SceneActBench
12:27官方账号arXiv cs.AI@Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming JinPathAgentBench评估视觉语言模型在整张病理切片上的四种能力:跨模态匹配、区域定位、多尺度推理。基准包含1822张TCGA整张切片和17135条诊断路径。在20个模型中,开源模型在多尺度推理上达到93%准确率,但诊断区域定位的IoU低于0.09。自主探索时高倍放大下命中率仅0.020,表明从WSI获取证据仍具挑战。AI模型PathAgentBenchTCGA病理图像推荐理由:想测试病理AI能不能像医生一样在超大图片里找病灶?这个基准专门考这个,结果发现定位能力还很弱。原文稍后读已读值得跟进有用关注 PathAgentBench
09:52官方账号arXiv cs.AI@Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng3D-DefectBench是一个用于系统分析基于视觉语言模型(VLM)的3D缺陷检测管道的基准和框架。它涵盖9种细粒度二分类缺陷(几何、纹理、提示遵循),通过平衡因子设计,在84种推理设计和约320万评分缺陷决策上变化4个管道因子(VLM、相机协议、视觉输入、提示方案)。模型选择是与人标注一致性最大的决定因素,但其他因子也影响性能并与模型选择交互。紧凑的六视图RGB协议与更密集的多视图设置性能相当。最佳VLM法官仍落后于经过训练的人类标注者。论文3D-DefectBenchVLM视觉语言模型推荐理由:想搞3D生成质量自动评估?这篇论文告诉你:光选模型不够,整个评估管道都得调。六视图RGB就够用,省成本。原文稍后读已读值得跟进有用关注 3D-DefectBench
09:16官方账号arXiv cs.AI@Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady该论文指出,当前追求消除摩擦的生成式AI(如通用对话模型)与结构设计师通过迭代摩擦激发创意的需求存在错位。研究者提出一个基于视觉语言模型的协同设计系统,使结构探索变得对话式、多模态,并能响应用户的演化意图。通过一个原型界面和与领域专家的研究,发现该系统能减少重复性建模摩擦,同时保留有益于创意生成的反思维摩擦。论文视觉语言模型结构设计人机交互推荐理由:这篇研究说AI一味追求“省事”反而帮倒忙——结构设计需要“摩擦”来激发灵感。他们用视觉语言模型做了个交互系统,帮设计师边想边改,保留思考摩擦,去掉重复劳动。原文稍后读已读值得跟进有用关注 视觉语言模型
09:11官方账号arXiv cs.AI@Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun LiHIVE是用于研究视觉语言模型幻觉后推理(PHR)的评估基础设施,支持在忠实caption与幻觉caption之间进行受控比较。在9个任务和9个模型上的实验表明,幻觉caption在视觉语言任务上平均提升准确率,而纯文本任务的影响有限且不稳定。进一步分析显示,幻觉线索扩展了语义覆盖范围并重塑推理动态,同时保持稳定的推理路径。该研究揭示了视觉语言模型中幻觉语义进入推理阶段后的具体影响机制。论文HIVEVLM幻觉后推理推荐理由:这篇论文用HIVE框架系统分析了VLM的幻觉后推理,发现幻觉caption反而提升部分视觉任务准确率,值得看看他们怎么设计和验证的。原文稍后读已读值得跟进有用关注 HIVE
09:08官方一手arXiv: OpenAI@Xin Li, Jiaju Han, Ma Yaqi, Chengyin Hu, Yingying Zhao, Jiahuan Long, Fengyu Zhang, Yahui Chai精选InfraQR 是一种针对红外视觉语言模型的攻击方法,将紧凑结构化补丁沿图像边界放置,通过代理 CLIP 编码器优化可学习网格单元。在 300 张红外图像基准上,InfraQR 将 OpenAI CLIP 的分类准确率从 98.67% 降至 0.70%。攻击还迁移到黑盒字幕和 VQA 模型,导致字幕语义退化,并在 GPT-5.4 评估下产生更易错的答案。结果表明红外视觉语言模型易受边缘结构化扰动影响,需进一步研究跨任务鲁棒性。论文InfraQRCLIPOpenAI1 个信源在谈事件专题推荐理由:这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。原文稍后读已读值得跟进有用关注 InfraQR
12:18官方账号arXiv cs.AI@Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank WangVAORA (Visual Action Outcome Reasoning Alignment) 提出两种互补奖励:Visual Alignment Reward 将 VLM 推理锚定到视觉上下文,独立于智能体动作;Visual-Action Alignment Reward 将推理与动作引起的视觉结果对齐。该方法在 PHYRE 和 Virtual Tool 基准上,针对未见任务和未见环境设置提升性能,抑制幻觉链式推理并缩小推理与行为差距。实验表明,VAORA 能诱导基于视觉的、可泛化的物理智能。AI模型VAORA视觉语言模型物理推理推荐理由:VAORA 用一个巧妙的奖励设计,让 VLM 在物理推理中不再瞎想,在 PHYRE 和 Virtual Tool 上泛化能力更好。原文稍后读已读值得跟进有用关注 VAORA
12:09官方账号arXiv cs.AI@Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long精选研究者提出AirflowAttack,首个针对红外遥感视觉语言模型的对抗攻击方法,利用热气流湍流作为扰动先验。该方法通过轻量生成器合成输入无关的扰动,在五个CLIP骨干上平均零样本场景分类攻击成功率达48.5%,超过四个物理基线(27.7-37.0%)。对六个SOTA视觉语言模型,场景分类准确率相对降低38.2%,但某些模型反而更自信地将扰动误判为真实热证据。消融实验显示气流先验在提升物理合理性时未牺牲攻击成功率。该基准覆盖十一个模型和四项任务,暴露了红外遥感视觉语言模型的脆弱性。论文AirflowAttack红外遥感视觉语言模型推荐理由:这篇论文把热气流变成攻击红外遥感模型的武器,攻击成功率48.5%,还能让模型更自信地犯错,搞AI安全的一定要看。原文稍后读已读值得跟进有用关注 AirflowAttack
09:53官方账号arXiv cs.AI@Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen论文提出UI2App基准,专门评估从截图推断交互行为的能力,无需文本或行为指导。基准包含327张截图,分为45个状态一致组,用于多路由网页应用。评估沿四个维度:可执行性、导航可达性、视觉保真度和交互推理,其中交互指标(IIS)按功能正确性和状态管理复杂度评分。在6个前沿视觉语言模型上,视觉保真度领先者仅得7.5的IIS,落后IIS冠军5.2倍;半数模型在高复杂度跨页面状态交互上得零。结果显示从静态截图推断完整交互行为仍是关键挑战。论文UI2App基准测试交互推理推荐理由:想测测视觉语言模型能不能只看截图就生成可交互的网页应用?这篇论文提出了UI2App基准,发现模型在视觉还原上还行,但交互推理差得远,最高分才7.5。原文稍后读已读值得跟进有用关注 UI2App
11:36官方账号arXiv cs.AI@Xuehui Wang, Xuankun Yang, Wei Shen视觉Token剪枝是加速VLM的关键策略,但现有方法在密集指令和细粒度查询下难以保留关键线索。本文提出EADP框架,首先利用统计熵量化并过滤文本噪声,得到细粒度的指令相关性分数;然后通过子模最大化问题与空间先验实现非冗余的Token选择。实验表明EADP在严格Token预算下提高了VLM的精度-效率平衡,在多个多模态基准上达到SoTA性能。论文EADP视觉语言模型Token剪枝推荐理由:这篇论文用熵过滤噪声、子模选择保留细节,在VLM加速上效果不错,适合想优化推理效率的人看看。原文稍后读已读值得跟进有用关注 EADP
09:43官方账号arXiv cs.AI@Duy Tran Thanh论文提出MagikaDocumentFromPixel,一个轻量级CPU图像质量门,在单个CPU核上约7ms判断图像为清晰、模糊或不确定。基于46配置8扫描经验搜索,发现输入分辨率是主导杠杆。引入边缘先验模块(EPM),通过拉普拉斯幅度辅助输入使F1提升1.3点。在GoPro Large帧上以384x384训练,F1达0.9803(AUC 0.9989),ONNX模型仅17 MB。局限性包括仅针对单一运动模糊分布和单次种子结果。论文MagikaDocumentFromPixelMobileNetV3-LargeEPM推荐理由:这论文搞了个超轻量的图像模糊检测模块,7毫秒就能判断,能帮下游视觉语言模型省掉很多无用计算。实测F1到0.98,模型才17MB,值得做生产管线的看看。原文稍后读已读值得跟进有用关注 MagikaDocumentFromPixel
13:55Geek@geekbb精选百度开源了一个基于DeepSeek-OCR升级的视觉语言模型OCR项目,支持一次性解析超长文档。该模型提供两种推理模式:gundam模式用于处理单张图片中的密集文字,base模式适用于多页文档或PDF。项目代码已在GitHub上发布,允许开发者直接使用。AI模型百度DeepSeek-OCR视觉语言模型推荐理由:百度开源的OCR模型,在DeepSeek-OCR上做了升级,能一次性处理超长文档和密集文字,两种模式很实用。原文稍后读已读值得跟进有用关注 百度
12:53官方账号arXiv cs.LG@Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville论文提出一种自举的Self-Filtering方法,通过迭代训练CLIP模型并动态筛选数据混合来提升训练数据质量。该方法在不需要额外数据或预训练模型的情况下,平衡了高置信度干净样本与全分布多样样本。实验表明,经该方法过滤后的视觉语言数据集在下游任务上性能显著提升。该方法避免了传统启发式或依赖参考数据集的局限。论文CLIP数据选择自过滤推荐理由:这篇论文教你怎么自动筛选高质量训练数据,用CLIP自己迭代过滤,效果比手动搞还好,还不用额外数据。原文稍后读已读值得跟进有用关注 CLIP
10:53官方账号arXiv cs.AI@Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting ZhuangSCOPE 提出一种自适应的符号规划框架,由 Symbolic Execution Simulator(SESim)和 Self-Adaptive Symbolic Memory(SASMem)两个模块协同工作。SESim 通过符号验证和实际执行反馈来 refine 行动计划和进化符号世界;SASMem 则将反馈蒸馏为可演化的符号知识。在开放环境实验中,SCOPE 使符号世界完整性提升,在环境扰动下计划成功率提高,并增强了跨任务泛化能力。AI模型SCOPE符号规划视觉语言模型推荐理由:搞机器人规划的朋友可以看看 SCOPE,它用符号执行加记忆更新解决开放世界符号不完整的老问题。原文稍后读已读值得跟进有用关注 SCOPE
10:15官方账号arXiv cs.AI@Shihao Ji, HongXi Li, Zihui Song, Mingyu LiLagrange提出基于掩码潜在场(MLF)的开放词汇稀疏驾驶框架,利用视觉语言模型(VLM)编码类无关目标提议为连续语义视觉标记。通过意图驱动的掩码交叉注意力模块过滤无关实体,将注意力解码为空间坐标上的隐式连续能量场。将决策制定为跨越该能量场的拉格朗日动作最小化问题,强制遵守车辆运动学并执行碰撞避免。在nuScenes和CODA基准上的离线评估显示,该框架实现了鲁棒、可解释且运动学可行的开放世界自主性。论文Lagrange自动驾驶视觉语言模型推荐理由:自动驾驶新框架Lagrange用掩码潜在场和VLM处理开放世界异常,比密集模型更高效,在nuScenes和CODA上表现不错。原文稍后读已读值得跟进有用关注 Lagrange
13:08官方账号arXiv cs.AI@Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Chengyin Hu, Fengyu Zhang, Yiwei Wei, Jiujiang GuoFusionRS是用于遥感双模态视觉语言学习的首个大规模RGB-红外-文本数据集。它由超过100万对对齐的RGB和红外风格图像组成,每对包含场景描述和红外感知描述。基于FusionRS训练的CLIP-style和生成式VLM模型在RGB-红外对齐、红外-文本检索和双模态描述任务上均优于纯RGB训练基线。消融实验表明,红外感知描述对强化红外-语言对齐至关重要。AI模型FusionRSRGB-红外遥感数据集推荐理由:FusionRS填补了RGB-红外双模态遥感数据集的空白,用公开RGB图转红外风格,加上两种描述,让模型同时理解可见光和红外信息。原文稍后读已读值得跟进有用关注 FusionRS
11:38官方一手arXiv: OpenAI@Marta Vallejo, Siwen Wang该研究通过十名参与者观看33张安全风险场景图像的眼动数据,生成人口平均注视热图。使用GPT-4o通过OpenAI Vision API生成视觉注意力显著性图,并与注视数据比较。空间对齐评估采用四个指标:皮尔逊相关系数0.515±0.117、NSS 0.988±0.323、KL散度1.766±0.844、AUC-Judd 0.806±0.076。与Gemini Pro、Gemini Flash和Claude的对比显示,所有模型AUC-Judd超过机会基线0.5且NSS为正。Gemini Pro在三个指标上定位最强,GPT-4o在KL散度上分布匹配最佳。论文GPT-4oGemini ProGemini Flash10 个信源在谈事件专题推荐理由:想知道AI能不能像人一样在危险场景下抓住关键区域?这篇论文用GPT-4o、Gemini Pro等模型做了对比,发现它们不靠眼动训练数据就能大致预测人类注视点。原文稍后读已读值得跟进有用关注 GPT-4o
11:12官方账号arXiv cs.AI@Jianzhe Lin论文发现验证器驱动的自DPO方法在视觉语言模型自改进中存在任务特异性问题。在MathVista、MMMU和BLINK上用开源验证器阶梯测试,同一验证器在MathVista上提升Qwen-3-VL-2B学生模型,但在MMMU上验证器准确率降至8%-23%,导致学生模型性能下降3.4-10.9个百分点。该现象在Qwen-2.5-VL-3B上复现。论文给出基于方差定理的机械论解释,指出目标任务验证器质量而非参数量才是关键。论文Qwen-3-VL-2BMathVistaMMMU推荐理由:验证器在新任务上会拖后腿原文稍后读已读值得跟进有用关注 Qwen-3-VL-2B
16:13官方一手marktechpost@Asif RazzaqZyphra 发布了 Zamba2-VL 系列开源视觉语言模型,包含 1.2B、2.7B 和 7B 三个参数版本。该模型采用混合 Mamba2 状态空间和 Transformer 骨干架构,在 Apache 2.0 许可下发布。与同类 Transformer 视觉语言模型相比,Zamba2-VL 在保持竞争力的同时,将首 token 生成时间降低了约一个数量级。这标志着在高效视觉语言推理方面的重要进展,尤其适合对延迟敏感的应用场景。AI模型视觉语言模型Mamba2Transformer推荐理由:做视觉语言模型部署或实时推理的开发者,Zamba2-VL 的首 token 延迟优势能显著提升用户体验,值得直接尝试。原文稍后读已读值得跟进有用关注 视觉语言模型
11:30官方账号arXiv cs.AI@Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu精选视觉语言模型(VLM)将图像投影为数百到数千个视觉令牌,导致解码器推理成本高昂。现有方法通常采用“排序并移除”范式,永久丢弃低分令牌。但研究发现,视觉令牌的重要性会随解码器深度变化,早期低分令牌可能在后续层变得重要。为此,研究者提出Reroute,一种无需训练的插件,将移除改为可恢复路由:被延迟的令牌在后续阶段重新进入候选池。该方法在FastV、PDrop等方案上,在LLaVA-1.5和Qwen骨干上,在激进令牌缩减下提升了接地性能,同时保持VQA性能。这表明VLM令牌缩减应视为可恢复路由,而非不可逆修剪。代码已开源。论文视觉语言模型令牌缩减可恢复路由推荐理由:VLM推理成本高是实际部署的痛点,Reroute用零训练代价解决了令牌缩减中信息丢失的问题,做多模态模型优化或部署的团队可以直接集成到现有方案中,值得一试。原文稍后读已读值得跟进有用关注 视觉语言模型