主要来源Gorden Sun
查看原文事件专题 ·多源确认
NVIDIA开源PixelUMM:一个模型同时支持图文和视频的理解与生成
NVIDIA开源了无编码器多模态模型PixelUMM,一套架构同时处理图像和视频的理解与双向生成。它去掉了传统独立的视觉编码器,把画面切分成像素块直接送入主模型,让输入理解和输出生成共用同一套底层表示。这种设计简化了多模态流程,模型和权重已完整开源。
当前结论
NVIDIA把PixelUMM开源了,一个模型搞定图文视频的理解和生成,做法是不用视觉编码器直接吃像素块,搞多模态研究的可以看看源码。
11 个信源71° AI 热度最后更新 2026/10/5 12:03:38
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。