跳到正文
原文
nvidia · Hugging Face 新模型· nvidia·· 9 小时前精选AI 评分60

NVIDIA 发布 PixelUMM 无编码器统一图像视频理解与生成模型

nvidia/PixelUMM

AI 导读

NVIDIA 发布 PixelUMM,这是一个无编码器统一多模态模型,可在像素空间中联合处理文本、图像和视频的理解与生成。模型采用 decoder-only Transformer、raw-pixel patch embeddings 和迭代像素生成头,语言骨干为 Qwen/Qwen3-8B,参数量为 15,199,672,064。

推荐理由

原文交代了无视觉编码器的像素空间路线和限制,可作为统一多模态建模的架构参考。

来源:nvidia · Hugging Face 新模型 · huggingface.co