论文研究普通
联合视频生成中的跨注意力鸿沟:RecCAR 让视频与动作、音频互相对齐
原始标题:All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation
内容摘要
研究者发现联合多模态扩散 Transformer 存在"互惠对应鸿沟":动作、音频等伴随模态能强对应视频,反向约束视频的对应却明显偏弱。为此提出 KL 正则化方法 RecCAR,以视频到模态的对应为固定参照,拉齐较弱的模态到视频对应。在视频-动作与视频-音频生成中,RecCAR 将 Human Anatomy 分数从 0.69 提升至 0.75,音视频不同步从 0.804 降至 0.752。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-07e64b92ed09711b7ddd004d