AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报

视觉-语言模型

共 3 条相关 AI 资讯
9月3日
09:11
09:11官方账号arXiv cs.LG@Jiahao Wu, Zhenqun Yang, Chen Jason Zhang, Qing Li
精选73°
TrajMind框架通过分离实时监控和按需诊断,解决了城市轨迹集体异常检测问题。该模型使用三个角色专用LoRA适配器在冻结的视觉-语言骨干网络上切换。TrajMind_slow在异常类型识别上比最强基线高出15.3个百分点,在定位上高出13.8个百分点。TrajMind_fast将延迟降低41.1%,同时保持93.5%以上的二分类平衡准确率。
论文TrajMindLoRA轨迹异常

推荐理由:TrajMind用快慢双路径解决轨迹异常检测,既保持高效监控又能精准诊断,跨城市表现稳定。
原文
7月13日
09:59
09:59官方账号arXiv cs.AI@Tianyou Jiang, Ziyu Zhou
TCLA是一种纯训练自由的少样本适应方法,针对医学视觉-语言模型(VLMs)在分布外(OOD)数据上性能下降的问题。该方法仅需少量支持样本即可校正推理逻辑,无需额外训练组件,在1-shot场景下依然稳定。在9个数据集(涵盖X光、超声、MRI、CT、组织病理学等模态)上,TCLA持续提升OOD性能,多数情况下超越现有基于训练的方法。
论文TCLAMedical VLMs视觉-语言模型

推荐理由:这篇论文提出了TCLA方法,不用训练就能让医学VLMs适应新数据,1-shot下效果比现有训练方法还好,很实用。
原文
6月11日
10:01
10:01官方账号arXiv cs.AI@Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran
精选
本文提出一种三阶段流水线,用于从监控视频中零样本理解事故,包括何时发生冲击、何种类型以及发生在画面何处。第一阶段通过视觉-语言相似性提取冲击附近的时间窗口;第二阶段利用元数据驱动多提示推理,结合五个互补视角(基线、运动、几何、对比和决胜)并通过熵门控成对裁决器解决分歧;第三阶段基于预测的事故类型和场景布局,使用开放词汇检测器定位冲击,并通过得分加权质心聚合关键帧检测结果。该方法在零样本ACCIDENT @ CVPR基准上显著优于中心帧基线,表明将零样本视频理解分解为时间定位、语义分类和空间定位能比直接提示更可靠地利用视觉-语言模型。
论文零样本学习视频理解多提示推理

推荐理由:这篇论文解决了监控视频中事故理解的零样本难题,做视频分析或安全监控的开发者可以直接借鉴其三阶段分解思路,比传统提示方法更可靠,值得一试。
原文
精选动态早读东盟登录