11:22官方账号arXiv cs.AI@Vanodhya G. Warnasooriya, Amir Hajian, Watchara Ruangsang, Supavadee Aramvith73°研究人员提出了一种轻量级两阶段框架,用于实时视频异常检测。第一阶段使用YOLO v11n-pose检测人物并提取17个骨骼关键点。第二阶段通过CLIP ViT-B/32编码每个裁剪的人物区域,并计算与预定义异常行为文本描述的余弦相似度。该架构在NVIDIA Titan XP GPU上实现了约51 FPS的端到端吞吐量,比多特征基线快3.36倍,同时在CUHK Avenue、ShanghaiTech Campus和朱拉隆功大学自建数据集上分别保持了89.26%、70.26%和84.13%的帧级AUROC值。论文YOLOCLIP视频异常检测推荐理由:新方法结合YOLO和CLIP,无需光流和独立姿态估计器,实时检测异常行为,速度提升3倍多。原文稍后读已读值得跟进有用关注 YOLO
11:22官方账号arXiv cs.AI@Yogesh Kumar精选近期研究将Mamba风格状态空间模型(SSMs)应用于视频异常检测,但现有方法仍依赖缓冲剪辑或窗口,缺乏对时间记忆与检测延迟关系的理论解释,仅通过GPU吞吐量而非目标边缘硬件来基准效率。我们引入了一种严格因果流异常检测器,其固定大小状态每帧更新时间为O(1),无前瞻和无剪辑缓冲。其时间核心是一个对角线性状态空间递归,具有输入和状态依赖的衰减门,通过在冻结视觉骨干上的因果下一嵌入预测进行自监督训练。我们推导出递归衰减频谱与检测延迟和可可靠捕获的最短异常之间的封闭形式关系,然后在UCSD Ped2和CUHK Avenue上进行实证验证。从学习到的基衰减(57到59帧)预测的收敛延迟界限远高于测量的检测延迟(1.6和18.4帧),表明事件边界门而不是基衰减控制响应速度。我们进一步报告了在Apple M3 Pro硬件上直接测量的端到端延迟和吞吐量,每帧0.74毫秒和0.77毫秒(超过1300 FPS),而不是模拟的GPU数字。未经调整的初始配置下,该方法在Ped2和Avenue上达到67.9%和70.2%的帧级AUC,略低于先前非因果SSM基线。在衰减率、状态大小和门控上的消融实验表明,门控贡献与数据集大小相关,在较小的Ped2训练集上损害准确性,但在较大的Avenue集上有所帮助。缩小准确性差距并将评估扩展到第三个更大的基准是下一步的紧急任务。论文视频异常检测状态空间模型MCP/工具推荐理由:这篇论文介绍了一种新的视频异常检测器,它具有更快的响应速度和更高的准确性,值得专业人士关注。原文稍后读已读值得跟进有用关注 视频异常检测
12:05官方账号arXiv cs.AI@Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed TabkhiVQ-VAD提出把人体关键点序列通过VQ-GAN量化为离散运动码本,只在正常动作上训练。VQ-VAD推理时若某段动作在码本里重建误差过高,就判定为异常。在HR-SHT上达到81.83%的域内准确率,从CMU Panoptic跨域到HR-SHT无需重训仍有76.69%。该方法在HR-SHT、CMU Panoptic等四个基准上做了域内、跨域和跨数据集三类评估,代码已开源。论文VQ-VADVQ-GAN视频异常检测推荐理由:VQ-VAD把动作量化成码本,重建误差高就是异常。HR-SHT上81.83%,跨域不重训76.69%,挺能打。原文稍后读已读值得跟进有用关注 VQ-VAD
12:18官方账号arXiv cs.AI@Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min XuO-VAD提出一种无训练、无领域知识的智能体框架,用于工业视频异常检测。该方法通过跟踪对象时空动态和状态演变,推理对象时间轨迹以识别异常。在三个IVAD数据集上,O-VAD超越了前沿视觉语言模型和传统异常检测方法。该方法提供可解释的异常过程与类型报告。AI模型O-VAD工业视频异常检测视频异常检测推荐理由:O-VAD不用训练就能检测工业视频异常,跟踪对象状态变化,比传统方法更准。原文稍后读已读值得跟进有用关注 O-VAD