AI Lens
  • 首页
  • AI 资讯
  • 产品拆解
  • 模型追踪
  • 洞察专栏
  • 关于
🔍 AI Lens
尝试看清 AI 产品的实质 · 数据每 30 分钟自动更新
© 2026 AI Lens · v2.0
返回 AI 资讯
📄 论文
X:谢赛宁 (@sainingxie)

V-RAE 将视觉基础模型表征用于视频生成

谢赛宁转发介绍 V-RAE,该模型直接采用冻结视觉基础模型(DINOv3、SigLIP2、EUPE、V-JEPA 2.1)的表征作为视频生成潜空间,而非传统 VAE 潜空间。在匹配设置下,V-RAE 在 Kinetics-600 上达 2.13 rFVD,UCF101 上 117.86 gFVD,收敛速度比 VAE 潜空间快 6 倍,并引入 tFVD 评估时序平滑度。

正在生成六维拆解…
读原文
这条对你有用吗?
六维拆解由 AI Lens 自动生成 · 帮你 5 分钟读懂一条资讯 · 仅供参考,以原文为准