
图生视频最难的地方从来不是“能不能动”而是“动了之后还是不是同一个人”。很多同学上手 ComfyUI 图生视频时都会遇到一个极其崩溃的瞬间第一张参考图的人物还很清晰到了第 30 帧人脸已经换了一张脸服装细节也完全丢失视频整体像是一个“换了演员”的翻拍现场。如果你正在被这个问题折磨那么今天这篇教程就是为你准备的。这篇教程要讲清楚一个目前 B 站和各大 AI 绘画社区都在讨论的高一致性图生视频组合z-image wan2.2。先说结论这套方案用 z-image 做关键帧一致性锚点再用 wan2.2 做视频生成/转绘是目前本地部署图生视频工作流里兼顾可控性、画质和人物一致性的实用方案之一。读完这篇文章你会搞明白什么叫“图生视频”什么叫“视频转绘”为什么 z-image 能解决人物漂移问题以及如何从零搭建一条完整的 ComfyUI 工作流跑通从单张图片到高质量视频的完整链路。在开始之前先做一个判断如果你只是偶尔玩一下图生视频对一致性要求不高那直接用在线工具就好没必要折腾本地工作流。但如果你有视频转绘、二创、角色一致性动画、批量生成素材的真实需求那么本地部署 ComfyUI 工作流是值得投入的。本文会尽量降低你的试错成本把踩坑点提前指出来。1. 这篇文章真正要解决的问题先说一个现象最近在社区里搜索“图生视频为什么还要积分”这个问题的人特别多。原因是很多在线图生视频平台把“视频生成”当成高消耗能力来收费一次图生视频可能消耗几十甚至上百积分而效果还不一定稳定。相比之下ComfyUI 本地部署的优势在于只要你有显卡跑多少次都不需要额外付费。但代价是你需要自己搭工作流、装模型、处理各种环境问题。真正让新手崩溃的其实是下面这几个连环问题第一是人物一致性。图生视频不同于文生视频它需要保证视频里的主体和输入图片是同一个人、同一套服装、同一个场景。但视频生成模型本身没有“锁定人物”的能力它只知道“生成一段和提示词匹配的视频”。所以如果只用一张图作为起点视频生成到后半段人物大概率会发生变化。第二是视频转绘与图生视频的区别。很多人把这两个概念混为一谈。图生视频是以一张图为起点生成新视频视频转绘是把一段已有的视频逐帧处理输出一种新的风格同时保留原始视频的运动轨迹和人物结构。这两种任务在 ComfyUI 里走的是完全不同的工作流逻辑很多人第一次接触时会混淆。第三是显存和性能限制。从热搜词里能看到大量类似“ComfyUI 5070显卡 gpu 显存不足”的搜索记录。这说明很多人兴致勃勃地搭好了环境结果一张图还没跑完显卡就爆了。视频生成任务对显存的要求比文生图高一个数量级如果不对参数和加载策略做优化再好的显卡也会被很快吃满。文章接下来会围绕这些问题展开先讲 z-image 和 wan2.2 是什么、为什么这套组合能提升一致性然后给出完整的本地部署流程、工作流搭建步骤、效果验证方法最后整理一份常见问题排查清单。2. z-image 与 wan2.2 核心概念与适用场景2.1 什么是 z-imagez-image 是一个开源图像生成与编辑模型基于 FLUX.1-dev 构建。它在传统文生图的基础上重点强化了“图像编辑”和“多图参考”能力可以理解为一句话它是一块能力更全面的“画板”既能根据文字生成新图也能根据参考图对指定区域做精准编辑。在 ComfyUI 的图生视频工作流里z-image 扮演的角色非常关键——“锚点生成器”。什么意思视频生成模型虽然擅长生成流畅的动态画面但不擅长记住人物细节。如果我们先用 z-image 基于同一张人物参考图生成多张高质量、角度不同但人物一致的关键帧然后把这些关键帧作为视频生成的锚点就可以有效约束视频生成的方向让人物在视频过程中保持一致。简单对比一下如果直接拿一张人物图丢给 wan2.2 生成视频模型会在运动过程中自己“脑补”人物细节脑补着脑补着就偏了。但如果先用 z-image 做一个“多视图人物一致性锚点图集”然后让 wan2.2 在这些锚点之间插值生成视频人物细节就有了明确参照。2.2 什么是 wan2.2wan2.2 是阿里通义实验室开源的视频生成大模型支持文生视频和图生视频。它在视频生成领域的优势是较强的运动控制和较高质量的动态画面表现同时也支持视频转绘场景。从社区反馈来看wan2.2 在本地部署的可行性、显存开销的可控性和出片质量之间取得了不错的平衡这也是它成为 ComfyUI 热门视频模型的原因之一。在 ComfyUI 里wan2.2 通常通过对应的采样器节点调用。你可以把 wan2.2 理解成一个“视频渲染引擎”它接收参考图片或关键帧序列结合提示词生成连续的视频帧。但它本身不是一个“会记人物长相”的模型所以必须配合 z-image 这类模型来控制人物一致性。2.3 为什么 z-image wan2.2 能解决一致性问题这套组合的核心逻辑可以用一句话概括让“记忆人物外观”这件事从视频生成模型身上剥离出来交给更擅长图像理解的模型来完成。在实际工作流中流程大概是这样的输入一张或多张角色参考图。使用 z-image 基于参考图生成一组关键帧这些关键帧之间保持人物一致。将关键帧和原始参考图一起作为 wan2.2 的输入条件。wan2.2 根据关键帧生成视频并在生成过程中尽量贴合关键帧的人物特征。这个流程看起来简单但实际搭建时有很多细节会影响最终效果。比如 z-image 生成的关键帧数量、帧与帧之间的差异程度、输入 wan2.2 的提示词结构、采样器的参数设置等任何一个环节没调好最终视频都会出现“像一下、又不完全像”的状态。2.4 这套方案适合谁、不适合谁适合的人群想本地部署并探索图生视频/视频转绘的爱好者。有二次创作、角色一致性视频、动画风格转绘等需求的创作者。需要批量生成视频素材想要通过 GPU 降低成本的生产者。不太适合的人群显卡显存不足 8GB 的用户除非使用云端 GPU 或在线服务。只想快速出片、不关心可控性的用户。对节点搭建完全没有耐心、只想一键出片的新手。3. ComfyUI 环境准备与模型部署在搭工作流之前需要先把 ComfyUI 环境准备好。这里分两种主流部署方式你可以根据自己的情况选择。3.1 方式一使用整合包快速部署如果你之前安装过秋叶整合包或类似的一键整合包那么 ComfyUI 的基础环境已经具备。整合包的优势在于内置了 Python 环境、常用节点和模型管理工具适合新手快速上手。使用整合包时需要注意新版整合包和旧版整合包的节点版本差异较大。搭建 z-image wan2.2 工作流时需要确保 ComfyUI 核心版本和关键节点库是新版。如果发现某些节点搜索不到优先检查是否符合以下要求ComfyUI 版本保持最新。已经安装 ComfyUI Manager节点管理器用于自动安装缺失节点。已安装与 wan2.2 对应的模型支持插件。3.2 方式二手动部署如果你更习惯手动部署可以按照下面的步骤操作。第一步准备环境# 建议使用 Python 3.10 或 3.11 git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI python -m venv venv source venv/bin/activate # Windows 下使用 venv\Scripts\activate pip install -r requirements.txt第二步启动 ComfyUI。默认情况下没有特殊参数但如果你显存有限可以考虑使用低显存模式python main.py --lowvram如果显存小于 8GB还可以进一步降低分辨率或者使用--cpu模式来测试工作流是否连通但视频生成不建议 CPU 模式。3.3 模型文件准备搭建这套工作流最少需要准备以下模型文件模型放置路径说明基础文生图模型如 FLUX 系模型ComfyUI/models/checkpoints/z-image 依赖的底层模型z-image 专用模型ComfyUI/models/z-image/或对应插件指定目录负责图像编辑与关键帧生成wan2.2 视频模型ComfyUI/models/diffusion_models/或ComfyUI/models/checkpoints/视频生成主干模型文本编码器/T5 等ComfyUI/models/text_encoders/等用于理解和编码提示词模型的具体下载地址请大家以各模型的官方仓库为准。有一点需要强调不同版本的 wan2.2 模型对采样器和 VAE 的要求可能不同。下载时优先选择与 ComfyUI 节点兼容的版本并注意查看模型卡页面中的使用说明不要随手找一个权重文件就放进目录。3.4 节点依赖安装搭建工作流时如果打开工作流 JSON 后出现类似“请安装缺失的包以使用此工作流”的提示这说明工作流依赖的某些自定义节点没有安装。解决方案有两种一种是通过 ComfyUI Manager 自动安装。在 Manager 界面点击“Install Missing Custom Nodes”它会自动检测缺失节点并安装。另一种是手动安装。在 ComfyUI 的custom_nodes目录下克隆对应的节点仓库然后重启 ComfyUIcd ComfyUI/custom_nodes git clone https://github.com/example/z-image-comfyui.git # 以实际仓库为准 pip install -r z-image-comfyui/requirements.txt安装完成之后重启 ComfyUI缺失节点提示应该就会消失。4. 工作流搭建z-image wan2.2 图生视频完整拆解这一部分是全文的核心。我们会逐步拆解一条可行的 z-image wan2.2 图生视频工作流。4.1 工作流整体结构先给一个整体视图。这条工作流包含四个逻辑组参考图输入模块加载人物参考图并统一尺寸。关键帧生成模块使用 z-image 节点基于参考图生成多张一致性关键帧。视频生成模块将关键帧序列和参考图输入 wan2.2 采样器生成初始视频。视频后处理模块对生成结果进行解码、降噪或帧率调整最终输出视频文件。如果你有视频转绘需求还需要额外增加一个“视频输入模块”先用 VAE 解码原始视频帧再经过 z-image 进行风格化处理最后送入 wan2.2 做视频重绘。这里先把最核心的图生视频流程讲透。4.2 参考图输入模块这一部分很简单用 ComfyUI 自带的Load Image节点加载参考图即可。需要留意的是图片尺寸。wan2.2 的视频生成分辨率通常以模型支持的尺寸为准。如果参考图过大或过小建议先用Image Resize节点统一尺寸而不是直接硬喂给模型。这里真正的关键点在于参考图的构图和质量直接决定最终视频的上限。如果参考图本身是模糊的、脸上有遮挡、身体比例奇怪那后续无论怎么调参都很难得到理想的视频。建议输入的参考图满足以下条件人物面部清晰正脸或四分之三侧脸为佳。全身或半身构图完整肢体无明显遮挡。光线均匀没有大面积过曝或过暗。分辨率不低于 512x512建议 768x768 或更高。4.3 关键帧生成模块z-image 的核心用法在 ComfyUI 中z-image 一般通过自定义节点调用。常见节点的输入包括参考图、提示词描述需要生成的关键帧内容、种子控制生成随机性、生成数量等。假设我们想基于同一张人物图生成三张不同景别的关键帧分别是“正面全景”“侧面中景”“特写镜头”。这时提示词可以这样写正面全景same person, full body, frontal view, standing posture, consistent clothing, cinematic lighting 侧面中景same person, medium shot, side view, same clothing, consistent face, cinematic lighting 特写镜头same person, close-up, front view, same clothing, consistent face, shallow depth of field虽然不同版本的中文提示词支持程度不同但建议统一使用英文提示词稳定性更高。生成关键帧时要注意z-image 的多参考图能力是这套方案的核心优势。你可以同时输入多张参考图比如正面照、侧面照、服装细节图模型会综合这些信息生成一个更稳定的“人物模板”。这一点比单参考图直接生成效果更好。关键帧生成后需要通过Image Concatenate或Image Batch节点把它们组合成一个序列作为后续视频生成的输入。4.4 视频生成模块wan2.2 采样器配置接下来是重头戏。将关键帧序列输入 wan2.2 采样器你需要关注以下参数帧数Frame Count指生成的视频总帧数。常见设置为 81 帧或 121 帧。81 帧在 24fps 下约 3.4 秒121 帧约 5 秒。帧数越多生成时间越长显存占用也越高。分辨率Resolution建议从 512x512 或 640x384 起步确认工作流跑通后再逐步提高到 768x768 或更高。如果一开始就设置 1024 以上的分辨率很容易直接爆显存。采样步数Steps最终成片建议 20-30 步。测试阶段可以先用 10-15 步快速验证效果但不要用低步数作为最终结果参考画质会明显下降。CFG 强度wan2.2 使用的 CFG 区间通常在 3.5-7 之间。这个值不是越高越好CFG 太高会导致画面过饱和、失真太低则可能导致画面与提示词脱节。建议从 5.0 开始调整。以下是一个简化的采样器配置示意实际节点名称以你安装的节点版本为准sampler: euler scheduler: simple steps: 20 cfg: 5.0 frame_count: 81 resolution: 640x384 seed: 424.5 视频后处理模块wan2.2 采样器输出的通常是 latent 张量需要用对应的 VAE 解码为视频帧图像。ComfyUI 中常见的输出节点是VAE Decode然后再通过Save Video节点保存为 mp4 或 gif 文件。在视频转绘场景中后处理部分还会涉及原视频帧的混合、去闪烁、色彩校正等操作。但这一步建立在基础工作流已经跑通的前提下新手可以先跳过把前面几个模块跑顺再说。5. 完整工作流 JSON 与关键参数参考很多同学喜欢直接导入工作流 JSON 文件再微调。这里提供一个最小可用的工作流结构示意只包含核心节点逻辑不包含完整 UI 坐标信息你可以根据自己的节点版本组合搭建。{ 3: { class_type: LoadImage, inputs: { image: reference.png } }, 10: { class_type: ZImageNode, inputs: { image: [3, 0], prompt: same person, full body, frontal view, consistent clothing, seed: 42, num_frames: 1 } }, 20: { class_type: Wan22Sampler, inputs: { images: [10, 0], prompt: the person walks forward, camera follows, cinematic lighting, sampler_name: euler, scheduler: simple, steps: 20, cfg: 5.0, frame_count: 81 } }, 30: { class_type: VAEDecode, inputs: { samples: [20, 0] } }, 40: { class_type: SaveVideo, inputs: { images: [30, 0], format: mp4 } } }注意这只是一个逻辑示意节点类名可能与你安装的插件不完全一致。搭建时建议先确认每个节点的真实类名和输入输出类型再按照上面的结构连接。如果你使用的是整合包也可以先参考社区分享的 z-image wan2.2 成品工作流导入后对照这张结构图去理解每个模块的作用会比从零搭建更快。6. 运行流程与效果验证搭建完成后运行工作流是另一道关卡。下面按照实际操作顺序说明如何验证效果。6.1 第一次运行前检查在点击“执行”按钮之前建议按如下顺序检查所有模型文件是否已经放置到正确路径。参考图是否已经加载并且没有被意外裁切。z-image 节点和 wan2.2 采样器节点的参数是否合理。如果安装了 ComfyUI Manager看一下节点依赖是否全部满足。6.2 运行与预期输出启动队列后可以在 ComfyUI 界面底部看到实时进度条包括当前执行到哪个节点、耗时多少。第一次运行时等待时间取决于你的显卡性能和帧数设置。在 5060 Ti / 5070 级别显卡上81 帧 640x384 的配置一般需要几分钟到十几分钟不等具体因显卡显存和算力而异。运行完成后工作流输出端会生成一个 mp4 文件。你可以点击预览窗口直接查看。正常效果应该是视频中的人物与参考图在五官、发型、服装、肤色等关键特征上保持一致运动自然流畅没有明显的人脸畸变和身份漂移。6.3 一致性效果验证这里给出一个简单可执行的验证方法将生成的视频逐帧抽帧选取第 1 帧、第 20 帧、第 40 帧、第 60 帧、第 81 帧与参考图做对比。重点看三个维度面部特征五官位置、轮廓、肤色是否一致。服装和道具款式、颜色、纹理是否一致。整体氛围光影、色调是否统一。如果视频中人物和参考图“神似而形不似”即整体气质像但细节变了说明 z-image 关键帧对视频生成的约束还不够强。需要增加关键帧数量或者加强提示词中对一致性的描述。6.4 视频转绘效果验证如果你做的是视频转绘需要额外关注“内容保真度”。转绘后的视频应该在保留原始视频的运动轨迹、镜头语言的基础上呈现出新的视觉风格。判断标准是原始人物的动作是否被保留。画面是否有闪烁或抖动。风格化是否一致没有出现部分帧像油画、部分帧像水彩的情况。如果出现闪烁可以考虑在 z-image 阶段对每一帧输入使用相同种子或者在后处理阶段加入帧间平滑节点。7. 常见问题与排查方法这里把这段时间大家在社区最常遇到的问题整理成一份排查表问题现象可能原因排查方式解决方案启动时提示“请安装缺失的包以使用此工作流”工作流依赖的自定义节点未安装查看控制台日志中的节点名使用 ComfyUI Manager 安装缺失节点或手动克隆仓库到 custom_nodes运行时报显存不足CUDA out of memory分辨率太高、帧数太多、同时加载多个模型查看 task manager 中的显存占用降低分辨率到 512x512 或 640x384减少帧数使用--lowvram启动视频中人物前后不一致z-image 关键帧数量不够或提示词约束不强抽取视频帧对比关键特征增加关键帧数量在提示词中强调一致性使用多张参考图画面闪烁严重视频转绘帧之间种子不一致、后处理缺失检查 z-image 输入帧的种子设置固定种子尝试加入帧间平滑节点生成视频运动幅度过小提示词没有描述运动、CFG 设置过低检查提示词与 CFG 参数在提示词中添加动作描述适当提高 CFG生成视频运动幅度过大导致人物变形CFG 过高、关键帧约束不足检查关键帧输入是否生效降低 CFG增加关键帧数量色彩偏灰或饱和度不足采样器步数过低、VAE 未正确配置检查步数和 VAE 节点提高步数到 20-30检查 VAE 是否匹配模型提示词不生效文本编码器未正确加载检查模型目录是否有对应 encoder根据模型说明放置对应的 text encoder 模型排查这类问题时一个通用的原则是首先降低负载再逐步恢复参数。比如先把分辨率降到最低、帧数降到 16 帧、步数降到 10确认工作流能跑通再一步步提高到目标画质。不要一上来就追求完美参数那样只会增加排查难度。8. 最佳实践与工程建议在这套工作流进入“能出片”阶段之后下面这些经验能让你少走弯路。8.1 善用“种子固定”种子Seed是控制随机性的关键。如果找到一个效果不错的生成结果立刻把种子记下来。后续微调其他参数时保持种子不变可以让你更清楚地知道“参数修改到底带来了什么变化”。在视频转绘场景中对每一帧使用相同种子是减少闪烁的最简单手段之一。8.2 关键帧数量不是越多越好很多人以为关键帧越多一致性越强但实际上关键帧过多可能导致 wan2.2 在插值时出现“骑墙”现象——模型不知道应该更贴近哪一帧反而会导致画面抖动加剧。更稳妥的做法是先用 2-3 张关键帧跑通全流程然后根据实际效果决定是否增加。如果画面一致性不足再增加到 4-6 张。8.3 分辨率与显存的平衡策略视频生成对显存的消耗远高于文生图。显存 8GB 以下建议以测试为主分辨率控制在 512x512 以内。显存 12GB 可以尝试 640x384 或 768x448。显存 16GB 以上可以比较从容地尝试 768x768 的分辨率。这里给出一个常用的显存优化组合使用--lowvram启动参数。将 batch size 保持为 1。避免同时加载多个模型到显存。在不使用时关闭其他占显存的程序。8.4 提示词中的“一致性锚点”在 z-image 阶段提示词里的关键不是描述动作和镜头而是反复强调“same person”“same clothing”“consistent face”。这样做的目的是让模型把参考图的特征视为不可变锚点。到了 wan2.2 阶段提示词的重点就切换为“人物在做什么、镜头怎么运动”。两个阶段的提示词分工不同不要混用。8.5 工作流版本管理与备份ComfyUI 工作流本质上是 JSON 文件强烈建议每次调整后导出保存一份。你可以把不同版本命名为workflow_v1.json、workflow_v2.json或者用日期命名。这样在调参改坏时能够快速回退不用重新搭建。8.6 素材管理规范建议为每个项目建立独立的素材目录包括参考图、关键帧、输出视频、工作流 JSON、提示词文本。这样不仅有利于后续复盘也方便在团队协作时共享。如果做批量生成还可以配合 ComfyUI 的 API 模式写脚本批量调用但那个话题留给后续文章。8.7 安全与合规提醒视频生成和视频转绘技术目前已经非常强大在使用过程中请务必注意版权和肖像权问题不要使用他人的肖像、美术作品、影视画面进行未经授权的二次创作或商业使用。在公开平台发布 AI 生成内容时建议标注“AI 生成”字样。涉及真实人物的视频生成或转绘需要获得明确的授权。不要将技术用于生成虚假、误导或违法内容。这一条看似是“老生常谈”但在实际项目中一旦忽视轻则下架重则面临法律风险。技术能力越强越要守住边界。9. 总结与后续学习方向到这里这篇文章的核心内容已经讲完了。我们围绕“人物一致性”这个图生视频最大的痛点拆解了 z-image wan2.2 这条工作流的技术逻辑和完整搭建过程。总结下来这套方案的价值在于用 z-image 的图像编辑能力补足了 wan2.2 在人物记忆上的短板让“参考图 → 关键帧 → 视频”的链路真正可控。对于下一步我给出的建议是分三步走第一步先把最基础的“单参考图 wan2.2 图生视频”跑通不追求完美效果先确保流程熟悉。第二步加入 z-image 关键帧生成环节对比有没有关键帧时的人物一致性差异。第三步再尝试视频转绘加入多帧输入和风格化处理。文中所涉及的 z-image 和 wan2.2 模型、ComfyUI 节点都推荐以各项目官方文档为准因为软件迭代很快版本之间可能存在差异。如果你在搭建过程中遇到文章里没有覆盖的问题先看 ComfyUI 控制台的报错日志再搜索日志中的关键报错信息这是解决大多数环境问题的通用路径。这套工作流值得你花一个周末的时间去折腾。跑通的那一刻你会发现本地 AI 视频创作的自由度是很多在线工具无法提供的。