模型发布 / 更新精选
MOVA 开源:可扩展的同步视频-音频联合生成模型
原始标题:MOVA:可扩展的同步视频-音频生成
内容摘要
OpenMOSS 团队发布并全栈开源音视频联合生成模型 MOVA,支持文本或图像到同步音视频生成,覆盖口型同步语音、环境音效和内容匹配音乐。模型采用 MoE 架构总参数 32B、推理激活 18B,视频塔基于 14B 的 Wan 2.2 I2V、音频塔来自 1.3B 文本到音频扩散模型,单段生成 720p、8 秒视听片段,通过 Aligned ROPE 缓解音视频时间轴漂移。
内容分类AI 模型发布与更新
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)
站内情报编号intel-ffa44db675502ed5167cd66f