22:44Patrick Loeber@patloeber73°Google昨日发布了基于Gemini的智能体视频理解功能。该功能由@MaartenGr制作视频详细解释。视频在YouTube上获得1268次观看。这项技术允许AI系统理解视频内容并执行相关任务。AI产品Gemini智能体视频理解推荐理由:Google刚发布了Gemini的智能体视频理解功能,有详细视频演示,看看它如何工作。原文稍后读已读值得跟进有用关注 Gemini
08:28shao__meng@shao__meng73°Google为Gemini系列推出Agentic Video Understanding功能,首发于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite版本。该技术将token消耗降低最高88%,分析成本降低最高66%,同时准确率提升最高7%。AVU技术从传统的'被动看'模式转变为'主动查'模式,模型可自主决定观看速度和内容片段。AI模型GeminiAgentic Video UnderstandingGoogle推荐理由:Google给Gemini加了个新功能,看视频更聪明还省钱,能自己决定看哪里,长视频分析成本大降。原文稍后读已读值得跟进有用关注 Gemini
03:21官方一手Google DeepMind: Blog(博客/媒体)Google发布Gemini新功能,支持智能体视频理解。该功能能分析视频内容并回答相关问题。Gemini在视频理解基准测试中表现优异。此功能已向部分用户开放使用。AI产品Gemini视频理解智能体推荐理由:Google给Gemini加了视频理解新功能,能看懂视频内容并回答问题,比普通视频分析更智能。原文稍后读已读值得跟进有用关注 Gemini
02:23官方账号Logan Kilpatrick@OfficialLoganKGoogle发布了关于智能体视频的博客文章。Gemini在视频理解基准上继续保持最先进水平。用户可以通过博客了解更多技术细节。Google期待收集更多用户反馈。AI产品Gemini视频理解智能体推荐理由:Google分享了Gemini在视频理解方面的最新进展,SOTA表现值得关注。原文稍后读已读值得跟进有用关注 Gemini
02:19Philipp Schmid@_philschmid73°Gemini 3.7 Flash、3.6 Flash和3.5 Flash Lite模型现已支持智能体视频理解功能。该功能可迭代导航视频时间线,自主选择观看内容、帧率和所需信息类型。在长视频处理中,可减少88%的token数量和66%的成本,并在基准测试中提高约7%的准确率。用户可通过设置processing="agentic"启用此功能。AI产品GeminiGemini 3.7 Flash视频理解推荐理由:Gemini API新增智能体视频理解,能自主分析长视频,大幅降低成本并提高准确率。原文稍后读已读值得跟进有用关注 Gemini
02:18官方账号Google DeepMind@GoogleDeepMind73°Google为最新Gemini模型添加了智能体视频理解功能。新模型能以更高精度分析视频,同时减少高达88%的token使用量。这一功能提升了视频内容处理的效率和准确性。AI模型Gemini视频理解智能体推荐理由:Google给Gemini模型加上了视频理解功能,比以前少用88%的token,分析视频更准了。原文稍后读已读值得跟进有用关注 Gemini
02:18官方账号Google DeepMind@GoogleDeepMindGemini不再扫描整个文件,而是基于视频转录文本、音频和帧进行推理,动态调整帧率提取所需时刻。这一方法在10分钟指南至多小时的长时间内容中效率提升显著。Agentic视频理解功能已通过API在Google AI Studio中面向3.7 Flash、3.6 Flash和3.5 Flash-Lite模型推出,并即将在Gemini App中上线。AI产品GeminiGoogleDeepMind视频理解推荐理由:GoogleDeepMind让Gemini能同时分析视频文本、音频和画面,只提取关键帧,长视频处理效率大增。原文稍后读已读值得跟进有用关注 Gemini
01:58Google AI Developers@googleaidevsGemini 3.7 Flash引入了新的智能体视频理解功能,能够准确识别并计数每一次拍手。传统AI处理视频时默认采用固定1帧/秒的速度,容易漏掉快速动作。Gemini通过自动调整处理速度解决了这一难题,避免了将拍手误判为其他快速动作。AI模型GeminiGemini 3.7 Flash视频理解推荐理由:Google的Gemini 3.7 Flash新增智能体视频理解功能,能自动调整处理速度准确计数拍手,解决了传统AI处理快速动作的难题。原文稍后读已读值得跟进有用关注 Gemini
13:08官方账号arXiv cs.AI@Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian FuObjectStream 是面向流式视频理解的无训练框架,把潜在目标作为记忆锚点。它直接从冻结的 Video-LLM 表征中提取空间连贯的潜在目标,跨帧链接为持久锚点,无需外部检测器或分割模型。在 OVO-Bench Real-Time Visual Perception 上,ObjectStream 使 Qwen2.5-VL-7B 提升 10.0 分,峰值 GPU 内存和 TTFT 均降低约 50%。在离线长视频基准上,它超越全 token 基线,同时丢弃 82.5% 的视觉 token。论文ObjectStreamQwen2.5-VL-7BVideo-LLM推荐理由:论文提出 ObjectStream,用目标当锚点压缩视频记忆,免训练提升理解,显存延迟减半,性能还涨 10 分。原文稍后读已读值得跟进有用关注 ObjectStream
17:26Qdrant@qdrant_engine精选Twelve Labs 在 Vector Space Day SF 上指出了视频处理的三种失败模式:Wrong Context、Wrong Memory 和 Wrong Reasoning。他们推出的 Marengo 检索模型把视频变成可搜索内容。Pegasus 视频语言模型将检索到的片段转化为结构化答案。Jockey 智能体框架负责视频语料库的工作流和记忆层。底层由 Qdrant 处理存储与检索。AI模型Twelve LabsMarengoPegasus推荐理由:Twelve Labs 用三件套解决了传统视频处理漏掉动态和因果的问题,想做视频检索和推理的可以看看这套方案。原文稍后读已读值得跟进有用关注 Twelve Labs
10:19Gary Marcus@GaryMarcusGary Marcus在X上指出,很多人认为AI可以观看并理解电影,但当他要求提供证据时,对方沉默。Marcus强调,目前没有研究证明AI能以24帧/秒以上速率理解全帧视频。他认为这项能力尚未实现。该帖子引发1410次浏览和13个点赞。行业Gary Marcus视频理解多模态推荐理由:Gary Marcus戳穿了AI能看懂电影的幻觉,问问那些跟风吹的人要证据,结果全哑了。这波打脸值得看。原文稍后读已读值得跟进有用关注 Gary Marcus
02:16AK@_akhaliqVideoChat3 是一款完全开源的视频多模态大型语言模型,专注于高效通用视频理解。该模型在视频问答、时序定位等任务上展现能力。开发者可通过 GitHub 获取权重与代码。AI模型VideoChat3视频理解多模态推荐理由:VideoChat3 完全开源,适合研究视频理解,你可以自己部署试试效果。原文稍后读已读值得跟进有用关注 VideoChat3
12:26官方账号arXiv cs.AI@Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles当前视频大语言模型在问答中表现优异但缺乏可验证的视觉依据。研究人员提出E-VQA(Evidence-Backed Video Question Answering)新任务,要求模型同时输出语义答案和精确的时空证据:时间片段与密集跟踪物体分割掩码。为此构建了首个经人工验证的像素级定位基准ST-Evidence,包含判别与生成两种任务。对现有模型的评估显示,问答准确率与真实视觉感知之间存在显著脱节,仅靠扩展规模无法解决。团队开发了自动化生成流程,创建16万规模的ST-Evidence-Instruct数据集,微调后的7B模型在UniPixel基线上获得+27.2 t-mean和+13.8 J&F的提升。论文E-VQAST-EvidenceSalesforce AI Research推荐理由:Salesforce AI Research 发布了 E-VQA 任务和 ST-Evidence 基准,解决了视频问答无法验证视觉证据的问题。如果你想理解视频模型真正“看到”了什么,这篇论文值得一读。原文稍后读已读值得跟进有用关注 E-VQA
20:29官方账号AlphaSignal@AlphaSignalAI精选MPMWorlds是一个包含95,000个2D仿真视频的基准,覆盖液体、雪、沙子和弹性体。模型观看2.5秒场景后预测后续运动。代码生成方法能保持长期物理稳定性,但无法从帧中读取位置,隐藏坐标后精度骤降。扩散模型可捕获短期几何,但物体随时间消失、运动不真实。混合两种方法的简单门控机制超越单一模型。论文MPMWorlds物理模拟代码生成推荐理由:这篇论文用MPMWorlds测试了AI看视频写物理代码的能力,发现代码生成稳但缺位置感知,扩散模型短时准但长期漂移,混合模型效果最好。原文稍后读已读值得跟进有用关注 MPMWorlds
09:43官方账号arXiv cs.LG@Amir Mann, Gal Michael Harari, Merav Keidar, Or LitanyVideoMDM 是一种基于扩散的框架,能够仅从单目视频中提取的精确2D姿态直接训练3D人体运动先验,无需任何3D真实数据。它利用预训练的2D转3D提升器提供近似3D姿态序列作为噪声教师,在3D空间扩散和去噪后,通过重投影到2D并与精确关键点比较进行监督。论文证明在温和假设下,深度加权的2D重投影损失在期望上等价于直接3D监督,并适配了速度一致性和过参数化表示对齐等标准3D运动正则化器。在HumanML3D数据集上,VideoMDM几乎缩小了与完全3D监督方法的差距(FID 0.88 vs 0.54),在真实视频数据集Fit3D和NBA上生成的运动更受人类偏好。论文3D人体运动生成扩散模型2D监督推荐理由:做3D人体运动生成的团队终于有了摆脱昂贵3D标注的可行方案——VideoMDM用2D视频就能训练出接近3D监督水平的模型,做动画、运动分析或虚拟人开发的可以直接试。原文稍后读已读值得跟进有用关注 3D人体运动生成
10:01官方账号arXiv cs.AI@Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran精选本文提出一种三阶段流水线,用于从监控视频中零样本理解事故,包括何时发生冲击、何种类型以及发生在画面何处。第一阶段通过视觉-语言相似性提取冲击附近的时间窗口;第二阶段利用元数据驱动多提示推理,结合五个互补视角(基线、运动、几何、对比和决胜)并通过熵门控成对裁决器解决分歧;第三阶段基于预测的事故类型和场景布局,使用开放词汇检测器定位冲击,并通过得分加权质心聚合关键帧检测结果。该方法在零样本ACCIDENT @ CVPR基准上显著优于中心帧基线,表明将零样本视频理解分解为时间定位、语义分类和空间定位能比直接提示更可靠地利用视觉-语言模型。论文零样本学习视频理解多提示推理推荐理由:这篇论文解决了监控视频中事故理解的零样本难题,做视频分析或安全监控的开发者可以直接借鉴其三阶段分解思路,比传统提示方法更可靠,值得一试。原文稍后读已读值得跟进有用关注 零样本学习
09:28官方账号arXiv cs.AI@Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang这篇综述从人类视角出发,系统梳理了多模态大语言模型(MLLM)在视频理解中的三大核心能力:观看(感知)、记忆(上下文保持)和推理(生成可靠输出)。文章提出统一框架,将视频理解系统分解为感知表征、记忆状态、推理轨迹和最终预测,并分析了时空感知、长视频高效处理、流式理解、忠实推理等关键挑战。作者按功能分类介绍了代表性方法,涵盖细粒度感知、多模态对齐、离线/流式记忆、纯文本与视频推理等方向,并讨论了第一人称、体育、教学、医疗等应用场景及评估基准。最后指出了可扩展、记忆感知、证据驱动的视频智能的未来方向。论文多模态大语言模型视频理解综述推荐理由:做视频理解或 MLLM 研究的同学,这篇综述帮你把碎片化的方法统一到“观看-记忆-推理”框架下,省去自己梳理文献的时间,值得收藏作为 roadmap。原文稍后读已读值得跟进有用关注 多模态大语言模型
10:18官方账号arXiv cs.AI@Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong多模态模型在长视频理解中,记忆能力成为关键瓶颈。现有基准多聚焦感知与推理,缺乏对记忆的系统评估。北京大学团队提出M³Eval,基于认知心理学设计任务,从信息保留、保真度、抗干扰性等维度评估模型记忆。实验发现,模型在并行视频流中难以保持分离表征,时空记忆可靠性差异大,符号记忆有限。该基准为多模态记忆研究提供了重要资源,揭示了模型记忆与人类记忆的显著差异。论文多模态模型记忆评估视频理解推荐理由:做多模态模型或视频理解的团队,M³Eval 帮你找到模型记忆的短板,看完你会重新思考模型架构设计。原文稍后读已读值得跟进有用关注 多模态模型
11:58官方账号arXiv cs.AI@Haowen Hou, Zhen Huang, Zheming Liang, Qingyi Si, Chenglin Li, Shuai Dong, Kele Shao, Ruilin Li, Dianyi Wang, Nan Duan, Jiaqi Wang精选视频相邻帧通常高度冗余,但现有视频多模态大模型仍将每帧独立编码为RGB图像,导致大量重复视觉token。AdaCodec提出一种预测式视觉编码接口:仅当场景无法从先前上下文预测时才发送完整参考帧,否则仅传输帧间变化(包括运动和预测残差)作为紧凑的P-token。在11个基准测试中,AdaCodec在相同token预算下优于Qwen3-VL-8B逐帧RGB基线;在长视频基准上,仅用1/7预算(32k token)即超越224k基线,并在通用视频基准上提升平均分数,同时将首token延迟从9.26秒降至1.62秒。论文视频理解多模态大模型预测式编码推荐理由:做视频理解或多模态模型优化的团队,终于有了一个能大幅降低计算开销而不牺牲性能的方案——AdaCodec用预测式编码直击视频冗余痛点,建议做视频MLLM的开发者直接看论文复现。原文稍后读已读值得跟进有用关注 视频理解
10:21Qdrant@qdrant_engineTwelve Labs 的 James Le 将在 Vector Space Day 上展示如何正确构建多模态检索,从体育和音频的语义搜索到处理目标跟踪和高光生成的智能体工作流。视频是信息密度最高的模态,但大多数检索管道仍将其视为带图片的文本。该演讲将展示向量搜索的前沿方向,适合对多模态检索和智能体工作流感兴趣的开发者。AI产品多模态检索向量搜索视频理解推荐理由:多模态检索是当前向量搜索的关键突破点,做视频理解、智能体或搜索系统的团队值得关注这场演讲,看看 Twelve Labs 如何将视频从“带图片的文本”变成真正的语义搜索对象。原文稍后读已读值得跟进有用关注 多模态检索
18:24berryxia@berryxia精选76°KwaiKeye 在 Hugging Face 开源了多模态模型 Keye VL 2.0-30B-A3B,总参数 30B 但活跃参数仅 3B,采用 Apache 2.0 协议。模型通过 DeepSeek 稀疏注意力实现 256K 上下文,视频理解能力随输入帧数增加而准确率上升,打破长视频导致模型迷失的直觉。在多个长视频基准上,其表现与 Qwen3 VL 和 Gemini 3 Flash 相当。该模型证明了稀疏注意力可同时兼顾长上下文和深度理解,是多模态领域的重要进展。AI模型多模态模型稀疏注意力开源/仓库推荐理由:做视频理解或多模态应用的开发者,终于有了一个长上下文和深度理解兼得的开源模型,建议直接去 Hugging Face 下载试试。原文稍后读已读值得跟进有用关注 多模态模型
17:38Philipp Schmid@_philschmid精选谷歌Gemini 3.5 Flash在视频理解、图像和音频等多模态任务中表现优异,但目前关注度不高。作者Phil Schmid认为该模型的能力被严重低估。该模型支持多种输入模态,适合复杂的多模态推理场景。AI模型Gemini 3.5 Flash视频理解多模态推荐理由:谷歌的Gemini 3.5 Flash多模态能力被严重低估了原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
08:00小互@imxiaohu一条推文将 Gemini Omni 形容为“视频版的香蕉”,暗示其具备强大的视频编辑与理解能力。作者认为它远不止视频编辑,而是世界模型的雏形,代表了通用 AGI 的初始形态。该推文引发了对 Gemini Omni 潜力的讨论,认为它可能推动 AI 从语言模型向多模态世界理解迈进。AI产品Gemini Omni世界模型AGI推荐理由:如果你关注多模态 AI 和 AGI 进展,这条推文点出了 Gemini Omni 可能超越视频编辑、成为世界模型雏形的关键判断,值得一看。原文稍后读已读值得跟进有用关注 Gemini Omni
11:38官方账号arXiv cs.AI@Haoyu Zhang, Qiaohui Chu, Yisen Feng, Meng Liu, Weili Guan, Yaowei Wang, Liqiang Nie精选MARS 是一个多模态智能体推理系统,专为 EgoVis 2026 的 CASTLE 挑战赛设计。该挑战要求回答 185 个关于四天活动、15 个同步视角、官方转录及多种辅助模态(如个人照片、热成像、心率数据)的封闭式问题。MARS 将任务视为多模态证据选择问题,通过构建视频和转录等主要来源以及辅助来源的证据记忆,并使用 DeepSeek 压缩长视频,最后通过 GPT-5.4 决策代理选择继续推理、请求缺失模态或生成答案。该系统在最终排行榜上获得第二名,代码已开源。AI模型多模态推理智能体视频理解推荐理由:多模态推理是 AI 落地的关键瓶颈,MARS 展示了如何整合视频、转录、热成像等异构数据做智能体决策,做多模态 AI 或视频理解的团队值得参考其开源代码。原文稍后读已读值得跟进有用关注 多模态推理
01:10AK@_akhaliqEgoMemReason 是一个新的基准测试,专门用于评估 AI 在长时间自我中心视频理解中的记忆驱动推理能力。该基准要求模型在观看长视频后,基于记忆回答关于事件顺序、因果关系和细节的问题。它填补了现有视频理解基准在长期记忆和推理方面的空白,对开发更智能的视觉助手和机器人有重要意义。论文基准测试视频理解记忆推理推荐理由:做视频理解或具身智能的团队终于有了一个专门测试长期记忆推理的基准——EgoMemReason 直击当前模型在长视频中“看完就忘”的痛点,做相关研究的建议直接拿来评估自己的模型。原文稍后读已读值得跟进有用关注 基准测试