📄 论文
X:谢赛宁 (@sainingxie)
V-RAE 将视觉基础模型表征用于视频生成
谢赛宁转发介绍 V-RAE,该模型直接采用冻结视觉基础模型(DINOv3、SigLIP2、EUPE、V-JEPA 2.1)的表征作为视频生成潜空间,而非传统 VAE 潜空间。在匹配设置下,V-RAE 在 Kinetics-600 上达 2.13 rFVD,UCF101 上 117.86 gFVD,收敛速度比 VAE 潜空间快 6 倍,并引入 tFVD 评估时序平滑度。
正在生成六维拆解…
这条对你有用吗?
六维拆解由 AI Lens 自动生成 · 帮你 5 分钟读懂一条资讯 · 仅供参考,以原文为准