ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

SkyReels-V2 无限长视频生成:从克隆仓库到 4 秒成片只要 3 条命令

SkyReels-V2 无限长视频生成:从克隆仓库到 4 秒成片只要 3 条命令 SkyReels-V2 无限长视频生成从克隆仓库到 4 秒成片只要 3 条命令【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2SkyReels-V2 是一个支持无限长度生成的开源视频生成模型基于 Diffusion Forcing 架构覆盖文生视频、图生视频、视频续写三个入口单次生成可从 4 秒拉到 60 秒。有一张 15GB 以上显存的显卡就能出片14B 旗舰模型则需要 50GB 以上。 它适合解决什么问题你在线上做片免费版一次只给 5-10 秒几段拼起来衔接生硬。这个项目的 DFDiffusion Forcing版本按块自回归生成块与块之间用重叠帧衔接30 秒、60 秒的长视频可以保持连续。你手里有一张静图想让它动起来。I2V 版本输入首帧加提示词即可出片还可以用--end_image指定结尾画面适合做同一个镜头的运镜效果。你已有一段短视频想把结尾续出去。把原片路径传给--video_path模型从原片最后一帧继续往后生成不用重做开头。 最短上手路径3 步从克隆到出片第一步拿到代码git clone https://gitcode.com/GitHub_Trending/sk/SkyReels-V2 cd SkyReels-V2官方测试环境是 Python 3.10.12依赖里含 flash_attn需要 CUDA 环境建议先在 Linux 独显的机器上操作。第二步装依赖pip install -r requirements.txtrequirements.txt 里版本锁得比较死torch 2.5.1、transformers 4.49.0、diffusers ≥ 0.31新建虚拟环境再装避免污染现有环境。第三步跑第一条视频python3 generate_video_df.py --model_id Skywork/SkyReels-V2-DF-14B-540P --resolution 540P --num_frames 97 --prompt A graceful white swan swimming in a lake at dawn --offload权重按--model_id从 Hugging Face / ModelScope 自动拉取输出默认存到./video_out97 帧按 24fps 算约 4 秒。显存不够就把--model_id换成Skywork/SkyReels-V2-DF-1.3B-540P纯文生视频入口则是 generate_video.py。⚙️ 参数怎么调关键参数速查表参数作用建议值调大 / 调小的效果--num_frames生成总帧数97约 4s、25710s、73730s越大视频越长、等待越久帧数与时长不是严格线性优先取官方对齐值--guidance_scale文本贴合强度T2V 用 6.0I2V 用 5.0调大更贴提示词但容易过饱和、形变调小生成更自由--base_num_frames每块基础帧数540P 用 97720P 用 121调低如 77、57可降低峰值显存但画质轻微下降别调太小--addnoise_condition给干净条件加噪的强度20调大让长视频衔接更平滑超过 50 反而开始不连贯--teacache_threshteacache 缓存阈值配合--teacache使用0.3调大推理更快画质有折损 背后是怎么跑的Diffusion Forcing 如何把视频续长传统视频扩散模型让所有帧以同一噪声水平一起去噪能生成的长度被训练时定死了。Diffusion Forcing 给每一帧分配独立的噪声水平干净帧噪声为 0相当于完全已揭晓全噪声帧相当于完全打码模型学习用干净帧作条件去恢复噪声帧。推理时就以上一段的结尾帧为条件逐块往外推长度因此没有硬上限整段同步扩散--ar_step 0只是它的一个特例所以官方可以直接从全序列模型微调出 DF 模型。训练侧的流程见下图先用 SkyCaptioner-V1 标注模型处理约 200 万条均衡视频数据再经过多阶段预训练、面向运动质量的 RL、DF 训练最后做 540p 和 720p 两轮高分辨率 SFT。想核对代码可以读 diffusion_forcing_pipeline.py文生 / 图生视频管道都在 skyreels_v2_infer/pipelines/视频标注模型在 skycaptioner_v1/训练细节以 README.md 的 Methodology 一节为准。⚠️ 常见坑与解法出问题时先查这里报 OOM → 加--offload把部分模块挪到 CPU参考峰值显存1.3B 540P 约 14.7GB14B 约 51.2GB16GB 卡建议直接上 1.3B或把--base_num_frames降到 77/57。长视频块与块之间跳变、接缝明显 → 加--overlap_history 17和--addnoise_condition 20这是官方长视频示例里的组合。画面不贴提示词 → 把主体、动作、场景三要素写进 prompt仍不理想就按上表调--guidance_scale或用--prompt_enhancer扩写峰值显存需 64GB且不能与--use_usp同用。生成太慢 → 加--teacache --use_ret_steps --teacache_thresh 0.3官方示例里 10 秒视频的同步推理就用了这套加速配置。换卡后想复现同一结果 → 固定--seed不传则每次随机。跑通第一条 4 秒视频后搭建工作就结束了剩下的是按上表调--num_frames和打磨提示词的事。完整参数说明在 README.md推理代码整体在 skyreels_v2_infer/ 目录下。【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表