模型多源确认71°

NVIDIA开源PixelUMM:一个模型同时支持图文和视频的理解与生成

精选理由

NVIDIA把PixelUMM开源了,一个模型搞定图文视频的理解和生成,做法是不用视觉编码器直接吃像素块,搞多模态研究的可以看看源码。

NVIDIA开源了无编码器多模态模型PixelUMM,一套架构同时处理图像和视频的理解与双向生成。它去掉了传统独立的视觉编码器,把画面切分成像素块直接送入主模型,让输入理解和输出生成共用同一套底层表示。这种设计简化了多模态流程,模型和权重已完整开源。

原文 · Gorden Sun

NVIDIA开源PixelUMM:一个模型同时支持图文和视频的理解与生成

NVIDIA发布了无编码器多模态模型PixelUMM,一套架构同时支持图像和视频的理解与双向生成。 它抛弃了传统的独立视觉编码器,把画面切分成像素块直接送入主模型处理,让输入理解和输出生成共用同一套底层表示。

这种设计大幅简化了多模态流程,为研究更原生的图文与视频一体化架构提供了完整开源参考。

模型:https://t.co/2O2lwzNWyY

  • kimmonismus10-05 12:42原文
  • techcrunch10-05 19:33原文
  • The Business Times: Tech10-06 05:09原文
  • The Straits Times: Business10-06 06:01原文
  • marktechpost10-06 17:30原文
  • NVIDIA AI10-06 13:12原文
  • Justine Moore10-06 19:01原文
  • Tech in Asia01:17原文
  • Nathan Lambert10-05 21:00原文
  • PyTorch10-06 18:36原文