8月26日
11:22
11:22官方账号arXiv cs.AI@Yogesh Kumar
精选
近期研究将Mamba风格状态空间模型(SSMs)应用于视频异常检测,但现有方法仍依赖缓冲剪辑或窗口,缺乏对时间记忆与检测延迟关系的理论解释,仅通过GPU吞吐量而非目标边缘硬件来基准效率。我们引入了一种严格因果流异常检测器,其固定大小状态每帧更新时间为O(1),无前瞻和无剪辑缓冲。其时间核心是一个对角线性状态空间递归,具有输入和状态依赖的衰减门,通过在冻结视觉骨干上的因果下一嵌入预测进行自监督训练。我们推导出递归衰减频谱与检测延迟和可可靠捕获的最短异常之间的封闭形式关系,然后在UCSD Ped2和CUHK Avenue上进行实证验证。从学习到的基衰减(57到59帧)预测的收敛延迟界限远高于测量的检测延迟(1.6和18.4帧),表明事件边界门而不是基衰减控制响应速度。我们进一步报告了在Apple M3 Pro硬件上直接测量的端到端延迟和吞吐量,每帧0.74毫秒和0.77毫秒(超过1300 FPS),而不是模拟的GPU数字。未经调整的初始配置下,该方法在Ped2和Avenue上达到67.9%和70.2%的帧级AUC,略低于先前非因果SSM基线。在衰减率、状态大小和门控上的消融实验表明,门控贡献与数据集大小相关,在较小的Ped2训练集上损害准确性,但在较大的Avenue集上有所帮助。缩小准确性差距并将评估扩展到第三个更大的基准是下一步的紧急任务。
推荐理由:这篇论文介绍了一种新的视频异常检测器,它具有更快的响应速度和更高的准确性,值得专业人士关注。
6月9日
13:11
13:11官方账号arXiv cs.LG@Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan Duan
Echo-Memory 是一项针对动作条件世界模型中记忆机制的受控研究。这类模型根据首帧、文本提示和相机动作序列生成多段视频,但其主要失败点往往是记忆而非局部图像合成:当相机离开再返回时,场景或关键物体可能悄然改变。现有记忆设计难以比较,因为增益与骨干网络、训练、检索和评估差异纠缠不清。Echo-Memory 固定了动作到视频的接口,仅改变历史信息的存储和读取方式,在共享的视频扩散骨干、优化器、相机动作表示、采样器和评估流程下,比较了原始上下文、基于压缩的记忆、不同读取路径的空间摘要以及状态空间循环。研究通过三分支协议(回放质量、域内循环重访和开放域返回探测)评估记忆,发现回放保真度不足以作为记住世界的代理指标。主要结论包括:原始上下文是强大的容量基线,能显著提升开放域返回性能;紧凑性不能替代容量;块状状态空间循环是最强的开放域返回机制。
推荐理由:做视频生成或世界模型研究的团队,这篇论文帮你拆解了记忆机制中容量、压缩、读取和循环四个关键维度,看完能直接指导你的模型设计。
5月28日
11:27
11:27官方账号arXiv cs.AI@Abhilash Durgam, Nyle Siddiqui, Jeffrey A. Chan-Santiago, Qiushi Fu, Elakkat D. Gireesh, Mubarak Shah
精选
CaMBRAIN 是首个基于 Mamba 的因果状态空间模型,专为脑电图(EEG)信号实时推理设计。现有深度学习模型依赖注意力机制,序列长度增加时计算量呈二次增长,且需滑动窗口处理,无法理解全局信号。CaMBRAIN 利用因果状态空间模型保持线性复杂度,并引入多阶段自监督训练,增强长程记忆能力。在三个 EEG 数据集上,CaMBRAIN 达到最先进性能,吞吐量比现有模型高 10 倍以上,首次实现变长 EEG 信号的连续推理。
推荐理由:做脑机接口或神经信号处理的团队终于有了能实时处理长序列 EEG 的工具——CaMBRAIN 解决了注意力机制的计算瓶颈,吞吐量提升 10 倍,做实时监测或临床诊断的开发者可以直接用。