ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Make-A-Video:文本直接生成视频,PyTorch 实现完整指南

Make-A-Video:文本直接生成视频,PyTorch 实现完整指南 Make-A-Video文本直接生成视频PyTorch 实现完整指南【免费下载链接】make-a-video-pytorchImplementation of Make-A-Video, new SOTA text to video generator from Meta AI, in Pytorch项目地址: https://gitcode.com/gh_mirrors/ma/make-a-video-pytorchMake-A-Video 是 Meta AI 推出的文本到视频生成模型输入一句文字描述输出一段连贯视频。这个仓库是它的 PyTorch 实现把其中的伪 3D 卷积和时间注意力拆成了可复用的模块你可以直接拿来用。它是什么给图像生成器装上「时间」的零件包先说定位这不是一个开箱即用的视频生成应用而是 Meta AI 文本到视频模型核心模块的开源实现。思路很直白文本到图像模型比如 DALL·E 2像一位只会拍单张照片的摄影师。Make-A-Video 的思路是把这位已经很出色的「摄影师」升级成摄像师——每一帧仍然沿用图像模型的技术再叠加两套时间机制让帧与帧连起来。上图来自原论文左侧是伪 3D 卷积每个 2D 空间卷积层后面跟一个 1D 时间卷积层右侧是时间注意力接在空间注意力之后。注意两条虚线标注——时间模块都初始化为「恒等映射」也就是训练之初相当于什么都不做不会干扰原有图像模型。它凭什么做到两个让视频「不抖」的技巧伪 3D 卷积把「空间」和「时间」拆开算直接在视频上做三维卷积计算量会随尺寸立方级增长。伪 3D 卷积把任务拆开2D 卷积负责处理每一帧内部1D 卷积负责处理帧与帧之间。打个比方砌墙不是整面墙一次浇筑而是一块砖一帧一块砖铺平再逐行逐帧对齐。每一步的工作量都小总开销远低于一步到位。这也是它比纯 3D 方案更省算力的原因。时间注意力让每一帧「看见」其他帧帧内内容靠空间注意力对齐帧与帧之间却没有人管。时间注意力补的就是这个缺口每一帧都能「看」其他帧并据此调整自己的内容动作才不会跳帧。这套机制的投影初始化为零训练开始时等效于直通。随着训练推进帧与帧才逐渐「协调」起来。正因为如此同一套代码可以先在图像上预训练再无缝切换到视频训练。另外实现里支持 Flash Attention一种省显存的快速注意力算法进一步压低计算成本。拿它能干什么你在自建文本到视频模型不用从零设计时间建模。把PseudoConv3d、SatioTemporalAttention或完整的SpaceTimeUnet嵌入你自己的 U-Net先拿图像训练再切到视频训练一套代码走到底省去最耗时的架构摸索阶段。你在研究视频时间建模可以在自己的数据上直接对比伪 3D 卷积与时间注意力两种方案并验证「恒等初始化」对训练稳定性的影响。️你只有图像数据也想复用完整的SpaceTimeUnet对图像和视频输入都不敏感传入图像时时间卷积与时间注意力自动跳过等于直接当一个 2D U-Net 用。核心源码在 make_a_video_pytorch/卷积、注意力、U-Net 各占独立文件。三步上手安装一行命令即可pip install make-a-video-pytorch如果想看源码克隆仓库git clone https://gitcode.com/gh_mirrors/ma/make-a-video-pytorch引入模块三个主要组件是PseudoConv3d伪 3D 卷积、SpatioTemporalAttention时空注意力、SpaceTimeUnet完整 U-Net。传入数据试跑视频张量形状是 (batch, 特征, 帧数, 高, 宽)图像少一维帧数直接传图像时时间相关计算会自动跳过无需额外处理。亮点与边界真实优势图像预训练与视频训练无缝切换恒等初始化让现成的图像模型能平滑升级为视频模型不用推倒重来计算成本低伪 3D 卷积把三维计算拆成 2D 1D再叠加 Flash Attention显存和耗时都明显可控模块划分干净每个组件独立可以只取所需混进你自己的架构适用边界它是核心模块库不是开箱即用的视频生成器没有预训练权重也不包含完整的文本到视频推理流水线。想真正产出视频需要自己搭配文本到图像模型并训练README 本身也标注了 work in progress持续完善中【免费下载链接】make-a-video-pytorchImplementation of Make-A-Video, new SOTA text to video generator from Meta AI, in Pytorch项目地址: https://gitcode.com/gh_mirrors/ma/make-a-video-pytorch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表