论文研究普通
V-RAE 将视觉基础模型表征用于视频生成
原始标题:great to see RAE extending to video!
内容摘要
谢赛宁转发介绍 V-RAE,该模型直接采用冻结视觉基础模型(DINOv3、SigLIP2、EUPE、V-JEPA 2.1)的表征作为视频生成潜空间,而非传统 VAE 潜空间。在匹配设置下,V-RAE 在 Kinetics-600 上达 2.13 rFVD,UCF101 上 117.86 gFVD,收敛速度比 VAE 潜空间快 6 倍,并引入 tFVD 评估时序平滑度。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:谢赛宁 (@sainingxie)
站内情报编号intel-fbd1dfac1cefd9e755b172e6