论文研究普通
PixelUMM:无需编码器的统一图像与视频理解生成模型
原始标题:PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation
内容摘要
PixelUMM 是一个无需视觉编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成。它将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干,并采用 Mixture-of-Transformers 架构结合共享注意力与任务专属参数,同时支持自回归文本预测和像素空间流匹配。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-51798af3d4d4a259b71937ed