09:11官方账号arXiv cs.LG@Jiahao Wu, Zhenqun Yang, Chen Jason Zhang, Qing Li精选73°TrajMind框架通过分离实时监控和按需诊断,解决了城市轨迹集体异常检测问题。该模型使用三个角色专用LoRA适配器在冻结的视觉-语言骨干网络上切换。TrajMind_slow在异常类型识别上比最强基线高出15.3个百分点,在定位上高出13.8个百分点。TrajMind_fast将延迟降低41.1%,同时保持93.5%以上的二分类平衡准确率。论文TrajMindLoRA轨迹异常推荐理由:TrajMind用快慢双路径解决轨迹异常检测,既保持高效监控又能精准诊断,跨城市表现稳定。原文稍后读已读值得跟进有用关注 TrajMind
09:59官方账号arXiv cs.AI@Tianyou Jiang, Ziyu ZhouTCLA是一种纯训练自由的少样本适应方法,针对医学视觉-语言模型(VLMs)在分布外(OOD)数据上性能下降的问题。该方法仅需少量支持样本即可校正推理逻辑,无需额外训练组件,在1-shot场景下依然稳定。在9个数据集(涵盖X光、超声、MRI、CT、组织病理学等模态)上,TCLA持续提升OOD性能,多数情况下超越现有基于训练的方法。论文TCLAMedical VLMs视觉-语言模型推荐理由:这篇论文提出了TCLA方法,不用训练就能让医学VLMs适应新数据,1-shot下效果比现有训练方法还好,很实用。原文稍后读已读值得跟进有用关注 TCLA
10:01官方账号arXiv cs.AI@Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran精选本文提出一种三阶段流水线,用于从监控视频中零样本理解事故,包括何时发生冲击、何种类型以及发生在画面何处。第一阶段通过视觉-语言相似性提取冲击附近的时间窗口;第二阶段利用元数据驱动多提示推理,结合五个互补视角(基线、运动、几何、对比和决胜)并通过熵门控成对裁决器解决分歧;第三阶段基于预测的事故类型和场景布局,使用开放词汇检测器定位冲击,并通过得分加权质心聚合关键帧检测结果。该方法在零样本ACCIDENT @ CVPR基准上显著优于中心帧基线,表明将零样本视频理解分解为时间定位、语义分类和空间定位能比直接提示更可靠地利用视觉-语言模型。论文零样本学习视频理解多提示推理推荐理由:这篇论文解决了监控视频中事故理解的零样本难题,做视频分析或安全监控的开发者可以直接借鉴其三阶段分解思路,比传统提示方法更可靠,值得一试。原文稍后读已读值得跟进有用关注 零样本学习