AI圈报
论文研究普通

Prism:面向原生 2K 联合视频-音频生成模型训练的动态稀疏注意力

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

内容摘要

Prism 是一个面向原生 2K 联合视频-音频生成模型训练的动态稀疏注意力框架,训练速度比全注意力快 2.5 倍,生成质量还超过全注意力。它把 token 序列组织成时空宏区块,用视频特征方差和音频到视频交叉注意力范数估计局部信息结构,为每个区块动态分配块形状,并采用混合块选择策略确定逐 query 稀疏度。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ff672bafcd7c751bc525ef9e