复旦大学联合华为诺亚提出VidRD框架，实现迭代式的高质量视频生成

WBOY

发布时间：2023-10-20 15:01:08

664人浏览过

来源于51CTO.COM

转载

A1.art

一个创新的AI艺术应用平台，旨在简化和普及艺术创作

下载

复旦大学联合华为诺亚方舟实验室的研究者基于图像扩散模型（ldm）提出了一种迭代式生成高质量视频的方案 ——vidrd (reuse and diffuse)。该方案旨在对生成视频的质量和序列长度上进行突破，实现了高质量、长序列的可控视频生成。有效减少了生成视频帧间的抖动问题，具有较高的研究和实用价值，为当前火热的aigc社区贡献了一份力量。

潜在扩散模型（LDM）是一种基于去噪自编码器（Denoising Autoencoder）的生成模型，它可以通过逐步去除噪声来从随机初始化的数据生成高质量的样本。但由于在模型训练和推理过程中都存在着计算和内存的限制，一个单独的 LDM 通常只能生成数量非常有限的视频帧。尽管现有的工作尝试使用单独的预测模型来生成更多的视频帧，但这也会带来额外的训练成本并产生帧级的抖动。

在本文中，受到潜在扩散模型（LDMs）在图像合成方面的显著成功的启发，提出了一个名为“Reuse and Diffuse”的框架，简称VidRD。该框架可以在 LDM 已经生成的少部分视频帧之后，产生更多的视频帧，从而实现迭代式地生成更长、更高质量以及多样化的视频内容。VidRD 加载了预训练的图像 LDM 模型进行高效训练，并使用添加有时序信息的 U-Net 网络进行噪声去除。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文标题：Reuse and Diffuse: Iterative Denoising for Text-to-Video Generation
论文地址：https://arxiv.org/abs/2309.03549
项目主页：https://anonymous0x233.github.io/ReuseAndDiffuse/

本文的主要贡献如下：

为了生成更加平滑的视频，本文基于时序感知的 LDM 模型提出了一种迭代式的 “text-to-video” 生成方法。通过重复使用已经生成视频帧的潜空间特征以及每次都遵循先前的扩散过程，该方法可以迭代式地生成更多的视频帧。
本文设计了一套数据处理方法来生成高质量的 “文本 - 视频” 数据集。针对现有的动作识别数据集，本文利用多模态大语言模型来为其中的视频赋予文本描述。针对图像数据，本文采用随机缩放和平移的方法来产生更多的视频训练样本。
在 UCF-101 数据集上，本文验证了 FVD 和 IS 两种评价指标以及可视化结果，定量和定性的结果显示：相较于现有方法，VidRD 模型均取得了更好的效果。

方法介绍

复旦大学联合华为诺亚提出VidRD框架，实现迭代式的高质量视频生成

图 1. 本文提出的 VidRD 视频生成框架示意图

本文认为采用预训练的图像 LDM 作为高质量视频合成的 LDM 训练起点是一种高效而明智的选择。同时，这一观点得到了 [1, 2] 等研究工作的进一步支持。在这样的背景下，本文精心设计的模型基于预训练的稳定扩散模型构建，充分借鉴并继承了其优良的特性。这其中包括一个用于精准潜在表示的变分自编码器（VAE）和一个功能强大的去噪网络 U-Net。图 1 以清晰、直观的方式展示了该模型的整体架构。

在本文的模型设计中，一个显著的特点是对预训练模型权重的充分利用。具体来说，大部分网络层，包括 VAE 的各组件和 U-Net 的上采样、下采样层，均使用稳定扩散模型的预训练权重进行初始化。这一策略不仅能显著加速模型的训练过程，还能从一开始就确保模型表现出良好的稳定性和可靠性。本文的模型可以在一个初始的包含少量帧的视频片段的条件下，通过重用原始的潜在特征和模仿之前的扩散过程，迭代地生成额外的帧。此外，对于用于在像素空间和潜在空间之间进行转换的自编码器，本文在其解码器中注入了和时序相关的网络层，并对这些层进行了微调，以提高时间一致性。

为了保证视频帧间的连续性，本文在模型中添加了 3D Temp-conv 和 Temp-attn 层。Temp-conv 层紧跟在 3D ResNet 后面，该结构可以实现 3D 卷积操作，以捕捉空间和时间的关联，进而理解视频序列汇总的动态变化和连续性。Temp-Attn 结构与 Self-attention 相似，用于分析和理解视频序列中的帧间关系，使模型能够精准地同步帧间的运行信息。这些参数在训练时随机初始化，旨在为模型提供时序结构上的理解和编码。此外，为了适配该模型结构，数据的输入也做了相应的适配和调整。

复旦大学联合华为诺亚提出VidRD框架，实现迭代式的高质量视频生成

图 2. 本文提出的高质量 “文本 - 视频” 训练数据集构建方法

为了训练 VidRD 模型，本文提出了一种构建大规模 “文本 - 视频” 训练数据集的方法，如图 2 所示，该方法可以处理 “文本 - 图像” 数据和无描述的 “文本 - 视频” 数据。此外，为了实现高质量的视频生成，本文也尝试对训练数据进行了去水印操作。

尽管当前市场上高质量的视频描述数据集相对稀缺，但存在大量的视频分类数据集。这些数据集拥有丰富的视频内容，每段视频都伴随一个分类标签。如 Moments-In-Time、Kinetics-700 和 VideoLT 就是三个代表性的大规模视频分类数据集。Kinetics-700 涵盖了 700 个人类动作类别，包含超过 60 万的视频片段。Moments-In-Time 则囊括了 339 个动作类别，总共有超过一百万的视频段落。而 VideoLT 则包含了 1004 个类别和 25 万段未经编辑的长视频。

为了充分利用现有的视频数据，本文尝试对这些视频进行自动化地更加详细的标注。本文采用了 BLIP-2、MiniGPT4 等多模态大语言模型，通过针对视频中的关键帧，结合其原始的分类标签，本文设计了许多 Prompts，以通过模型问答的方式产生标注。这种方法不仅增强了视频数据的语音信息，而且可以为现有没有详细描述的视频带来更加全面、细致的视频描述，从而实现了更加丰富的视频标签生成，以帮助 VidRD 模型带来更好的训练效果。

此外，针对现有的非常丰富的图像数据，本文也设计了详细的方法将图像数据转换为视频格式以进行训练。具体操作为在图像的不同位置、按照不同的速度进行平移和缩放，从而为每张图像赋予独特的动态展现形式，模拟现实生活中移动摄像头来捕捉静止物体的效果。通过这样的方法，可以有效利用现有的图像数据进行视频训练。

效果展示

描述文本分别为：“Timelapse at the snow land with aurora in the sky.”、“A candle is burning.”、“An epic tornado attacking above a glowing city at night.”、以及“Aerial view of a white sandy beach on the shores of a beautiful sea.”。更多可视化效果可见项目主页。

复旦大学联合华为诺亚提出VidRD框架，实现迭代式的高质量视频生成

图 3. 生成效果与现有的方法进行可视化对比

最后，如图 3 所示，分别为本文生成结果与现有方法 Make-A-Video [3] 和 Imagen Video [4] 的可视化比较，展现了本文模型质量更好的生成效果。

LeonardoAI如何调整画面比例_LeonardoAI比例设置方法【说明】

QuillBot网页版和插件版有什么区别_QuillBot版本差异说明【介绍】

JasperAI如何提高写作质量_JasperAI提示词设置技巧【指南】

QClaw配置文件在哪个位置_QClaw配置文件路径说明【说明】

ChatGPT无法生成内容怎么办_ChatGPT常见故障排查方法【解答】

数码产品性能查询

该软件包括了市面上所有手机CPU，手机跑分情况，电脑CPU，电脑产品信息等等，方便需要大家查阅数码产品最新情况，了解产品特性，能够进行对比选择最具性价比的商品。

下载

相关专题

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4119

2026.01.21

github中文官网入口 github中文版官网网页进入

4119

2026.01.21

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2904

2024.08.16

PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境（CLI）下的开发与应用，内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理，以及与 Linux 定时任务（Cron）的结合使用。通过实战示例，帮助开发者掌握使用 PHP 构建自动化脚本、批处理工具与后台任务程序的能力。

2025.12.13

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

216

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

412

2026.03.04

热门下载

网站特效

网站源码

网站素材

前端模板