ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

本地部署ComfyUI跑AI视频:高清双采样工作流实战

本地部署ComfyUI跑AI视频:高清双采样工作流实战 本地跑 AI 视频听起来很重实际上现在确实有解了。如果你一直在用在线工具生成视频或者手头有一台配置还行的 Win/Mac 电脑其实完全可以走 ComfyUI 本地部署这条路不依赖订阅、不按次收费、不限制生成数量显卡足够的情况下出图出视频都是零成本。这篇文章我准备把整套流程串起来从 ComfyUI 是什么讲起到手把手教你在 Windows 和 Mac 上安装整合包、加载模型、搭一套“高清双采样”文生图工作流然后再升级到图生视频最后附上常见报错排查和效率优化建议。无论你是纯新手还是已经玩过 WebUI 想切到 ComfyUI这篇文章都能直接照着做。1. ComfyUI 是什么为什么会成为 AI 视频/文生图的新选择1.1 从 Stable Diffusion 到 ComfyUI很多接触过 AI 绘画的朋友都知道 Stable Diffusion 的 WebUI最典型的就是 A 站那套界面它用起来相对直观填提示词、点生成、等出图。但随着工作流越来越复杂WebUI 的缺点也开始暴露单个功能的开关多、节点关系不透明、想要串联多个模型时界面会变得很臃肿。ComfyUI 是另一种思路。它把生成过程拆成一个个可视化的节点每个节点对应一个明确的操作例如“加载模型”“编码提示词”“采样器生成图像”“保存图片”。节点之间用连线连接像一个流程图。这样做的好处非常明显每一步的输入输出都是显式的用户能清楚看到数据从哪里来、到哪里去多个模型、多个采样器可以自由串联组合出更复杂的工作流对显存的控制更精细可以“跑一步、释放一步”降低显存压力同样一个任务在 ComfyUI 里的启动速度和资源占用通常比 WebUI 更轻。正因如此社区里大量高质量工作流都优先发 ComfyUI 版本文生图、图生图、风格迁移、局部重绘、图像放大再到视频生成几乎都能找到对应的节点和工作流文件。1.2 为什么选择本地部署零成本生成所谓“零成本”不是说完全不用花钱而是指不依赖在线 AI 服务按次扣费或订阅。本地部署的核心成本是硬件一台带独立显卡的电脑。只要你手头有显卡电费其实是唯一软成本。相比在线工具本地部署有几个明显优势不限制生成次数在线工具通常有免费额度用完就要等待或付费本地部署只要显卡不炸想跑多少次都行。数据不出本机图片和视频素材直接保存在本地没有上传隐私问题也不会被平台审核和打标。工作流可控你可以把整套节点配置存成 JSON 文件分享给朋友或者改一两个参数看效果差异自由度远超在线工具。版本更新快ComfyUI 社区迭代速度非常快新模型、新插件往往在发布后几天就能在 ComfyUI 中用起来不需要等平台适配。当然本地部署的门槛也是存在的。显卡越强生成速度和分辨率上限越高显存不足时需要合理设置分辨率、加载低精度模型、开启显存优化选项。这也是我们在后文要重点讲的内容。1.3 高清双采文生图是什么意思“高清双采”是一个比较通俗的叫法简单说就是跑两轮采样第一轮用基础模型生成一张低分辨率但构图合理的图第二轮在低分辨率图的基础上通过放大模型或者重绘方法再采一次样把细节、清晰度拉高最终输出高清成品。在 ComfyUI 中这个过程体现为两个采样器节点串联第一个 KSampler 负责生成底图第二个 KSampler 配合放大模型如 Ultimate SD Upscale或 latent 放大流程对底图进行细节修复。这样做的好处是既控制了显存占用又能最终得到大尺寸、高细节的图片。很多人觉得高清图就得一次采样生成 1024x1024其实不然。一次直接生成高分辨率图对显存要求极高而且画面容易出现结构崩坏、肢体畸形。双采样策略更像是“先搭骨架再填肉”第一轮先把构图和轮廓定了第二轮再修复细节和纹理。这套思路延伸到视频生成领域也同样适用。2. 环境准备Win/Mac 硬件说明与显卡分析2.1 操作系统与基本要求ComfyUI 是一个 Python 项目本质上不挑操作系统。Windows、macOS、Linux 都可以跑区别主要体现在依赖库的底层加速支持上Windows支持最完善。NVIDIA 显卡通过 CUDA 加速AMD 显卡可以通过 DirectML 或 ROCm 加速Intel 显卡也有对应的运行分支。社区整合包大多以 Windows 为主开箱即用体验最好。macOSApple Silicon 芯片M1/M2/M3 及更高版本可以通过 PyTorch 的 MPS 后端调用 GPU 加速。Intel 芯片的 Mac 虽然也能运行速度会明显偏慢通常不太建议拿来跑文生图和视频生成。Linux适合服务器或开发者环境需要手动配置 CUDA 和 Python 环境步骤略繁琐但稳定性更高。本文的实操部分以 Windows 为主Mac 用户我会单独说明注意点。2.2 显卡与显存分析30 系、40 系、50 系显卡是本地生图最重要的硬件。目前在 ComfyUI 中能发挥最佳性能的是 NVIDIA 显卡主要因为 CUDA 生态和 PyTorch 支持得最早。按显存大小大致可以分为几个梯队显存等级常见显卡适合玩法8GB 以下GTX 1660 Super、RTX 3060 Laptop基础文生图、小分辨率图生视频跑慢一点但能用8GB 左右RTX 3060、RTX 4060主流文生图 512x768 很流畅可以尝试短视频片段生成12GB ~ 16GBRTX 4070/4080、RTX 3080/3090高清双采、复杂工作流、较长视频片段整体体验优秀20GB 以上RTX 3090/4090、50 系大显存型号训练 LoRA、长视频、大分辨率批量出图接近专业生产力关于 40 系和 50 系显卡这里想多说一句。50 系显卡架构较新需要较新版本的显卡驱动也需要整合包中自带的 PyTorch 和 CUDA 版本提供对应支持。如果你用的是 50 系显卡建议选择近期更新的整合包并保持驱动更新。40 系显卡是目前兼容性最稳的选择30 系则在性价比上仍然很有竞争力。显存不是越高越好但肯定是越大越省心。如果显存只有 8GB仍然可以生成 1024 级别的高清图秘诀就是“低分辨率出图 放大”路线而不是直接怼高分辨率。这也是我们选择高清双采工作流的核心原因。2.3 内存、硬盘和网络环境除了显卡另外几个容易被低估的因素分别是内存建议至少 16GB32GB 更稳妥。ComfyUI 在加载模型和预处理视频帧时内存占用会明显上升内存不够会导致启动失败或中途退出。硬盘ComfyUI 本体只有几百 MB但模型文件体积很大。基础 Stable Diffusion 模型通常是 2GB~7GB放大模型、视频模型、ControlNet 模型又是几十 GB 打底。建议使用 NVMe 固态硬盘至少预留 100GB 可用空间否则下载模型后很容易爆盘。网络第一次安装整合包和下载模型时会涉及到访问模型托管源的问题。国内网络环境下建议在整合包中配置国内镜像源来拉取模型和插件具体方法在常见问题章节会讲。3. ComfyUI 整合包安装详解3.1 什么是整合包为什么推荐整合包ComfyUI 的原版需要手动安装 Python、PyTorch、ComfyUI 源码以及各种依赖库对新手来说光是环境报错就能劝退一半人。整合包做的事情就是把 Python 环境、ComfyUI 主程序、常用插件、默认模型配置、启动脚本全部打包在一起下载解压后直接运行启动脚本就能进入界面。社区里比较常见的有“秋叶整合包”这类作品。严格来说它们并不是 ComfyUI 官方发布的而是社区爱好者为了方便新手而整理的一键包。整合包的优点很明显自动配置 Python 和依赖省去手动安装和版本兼容问题预装常用的插件、节点和模型目录结构目录规范提供启动前配置界面可以在启动前选择加速方式、显存优化模式自动增加国内源切换选项下载插件和模型更方便。当然使用整合包也要注意来源一定要选择可信渠道尽量找更新时间较新的版本避免捆绑无关软件。3.2 整合包下载与解压下载整合包之前先确定自己的硬件类型。标题中常见的“满血版整合包”通常指的是内置了较多模型和插件、解压后开箱即用的版本如果硬盘空间有限也可以选择精简版解压路径不要放在中文目录和带空格的目录下面。比如D:\AI\ComfyUI就可以不要用D:\软件\AI 绘画\ComfyUI。解压时建议右键选择“解压到当前文件夹”等待完整解压避免遗漏文件。解压完成后目录下应该有一个启动脚本Windows 通常是启动ComfyUI.bat或run_nvidia_gpu.batMac 用户则看对应的.command或.sh脚本。这里特别说明如果你使用的是社区整合包首次解压后很可能杀毒软件会误报因为 Python 脚本会被某些安全策略拦截。遇到这种情况先把整合包目录加入杀毒软件信任区再重新启动。3.3 首次启动与访问 Web 界面Windows 下启动步骤如下双击启动脚本等待终端窗口自动运行。首次启动时脚本会检查 Python 环境、网络连接、插件依赖可能需要下载一些资源耐心等待。启动成功后终端会输出一个本地地址一般是http://127.0.0.1:8188。浏览器打开这个地址就能看到 ComfyUI 的 Web 界面了。如果终端窗口一闪而过或者报错通常是 Python 环境变量被干扰。整合包一般自带“重新安装依赖”选项或者可以尝试右键管理员身份运行。Mac 用户如果遇到permission denied先对脚本执行chmod x再双击运行。4. 加载模型与基础节点认知4.1 模型放在哪个目录ComfyUI 的模型目录结构是有固定规定的。解压整合包后会看到一个models目录下面有多个子目录ComfyUI/ ├── models/ │ ├── checkpoints/ # 主模型如 SD1.5、SDXL │ ├── loras/ # LoRA 模型 │ ├── vae/ # VAE 模型 │ ├── controlnet/ # ControlNet 模型 │ ├── upscale_models/ # 放大模型 │ └── video/ # 视频生成相关模型 ├── custom_nodes/ # 插件节点目录 ├── output/ # 生成结果输出目录 └── 启动脚本把下载好的模型文件放入对应目录即可。整合包通常会在models/checkpoints里预装一个基础模型这样解压后就能直接开始文生图。如果你用整合包自带的模型管理功能下载模型它会自动归位不需要手动移动。手动下载时要注意命名规范尽量用英文和数字命名避免文件路径中带有中文导致加载失败。4.2 ComfyUI 基础节点速览打开 Web 界面后默认有一个最简单的文生图工作流这里面涉及几个核心节点Checkpoint Loader负责加载主模型输出模型对象、CLIP 对象和 VAE 对象。CLIP Text Encode负责把提示词编码成条件向量正面提示词和负面提示词各用一个。Empty Latent Image设置生成图片的尺寸和批次大小。KSampler采样器是生成过程的核心负责控制步数、强度、采样器算法和降噪强度。VAE Decode把潜空间数据解码成像素级图片。Save Image把结果保存到output目录。看到这里先不用着急理解每个细节后面实战时我会逐个参数解释。想快速掌握 ComfyUI 的关键就是找到“哪个节点干了什么活”然后在默认模板上做加法。4.3 从默认模板开始修改第一次打开 ComfyUI界面里已经有一张“默认工作流”包含加载模型、两个提示词节点、KSampler、VAE Decode 和保存节点。想直接生成一张图只需要选择你下载好的主模型在正面提示词节点输入描述内容点击右上角的“执行”按钮Queue Prompt等待进度条走完在输出目录查看图片。如果界面空白可以在菜单栏Workflow → Browse Templates中找到默认模板或者点击Load Default按钮。整个思路非常直观节点像积木连线决定数据流方向。5. ComfyUI 高清双采文生图实战5.1 为什么要双采样而不是一次高分生成直接生成高分辨率图片对显存和内存的占用非常大而且采样器面对大尺寸 latent 时容易出现结构性问题比如人物比例失衡、背景杂乱。双采样策略的核心思路是第一次采样生成一个小图尺寸可以是 512x768 或 768x512通过放大模型把图像放大 1.5 倍或 2 倍第二次采样在小图放大的基础上重新绘制细节此时由于主体结构已经确定采样器只需要修复纹理和锐度不容易跑飞。这样做的好处是既降低了高分辨率生成的压力又能得到接近直出高分图的观感。尤其是 SD1.5 时代的模型高分辨率直接生成时经常会出现“多头”“多手”的结构崩坏问题双采样能极大缓解。5.2 文生图双采工作流节点搭建下面是一套完整的文生图双采工作流按节点依次添加即可。第一步加载主模型添加一个Load Checkpoint节点选择你的主模型。如果选择的是 SDXL 模型提示词编码节点也需要配合 SDXL 设置。第二步正面与负面提示词编码添加两个CLIP Text Encode节点分别连接主模型输出的 CLIP 接口。一个填写正面提示词一个填写负面提示词。负面提示词建议写lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, jpeg artifacts, blurry。第三步第一次采样添加Empty Latent Image节点设置尺寸为 512x768。再添加KSampler节点参数参考seed随机种子控制生成结果的随机性steps采样步数SD1.5 模型建议 20~30SDXL 建议 25~35cfg提示词引导强度一般 7 左右sampler_name采样器常用dpmpp_2m或euler_ascheduler调度器常用karrasdenoise第一次采样时设为 1表示全量生成。第四步放大图像添加Upscale Image节点使用简单放大或者加载放大模型后再放大。简单放大的话可以用Image Scale节点把第一次生成的图像放大到 1024x1536 附近。如果想效果更好可以添加Ultimate SD Upscale节点但那个节点需要安装 ControlNet 相关的插件支持而且配置更复杂。新手先使用普通放大节点即可。第五步第二次采样把放大后的图像连接到第二个KSampler节点再从主模型连接条件向量。这里的关键参数是denoise第二次采样时一般设为 0.4~0.6表示在放大图像的基础上保留部分原图结构同时重新绘制细节。denoise数值过高会丢失原构图数值过低放大后图像会模糊、细节填充不足。建议从 0.5 开始调。第六步VAE 解码与保存把第二次采样的 latent 连接VAE Decode再连接到Save Image。点击执行生成结果就会返回到界面。5.3 高清双采工作流完整 JSON 示例在 ComfyUI 中工作流可以导出为 JSON 文件也可以粘贴 JSON 导入。下面给出一个最小可运行的双采工作流 JSON你可以在 ComfyUI 界面中点击菜单栏的打开工作流Load或直接粘贴导入。这段 JSON 基于常见节点 id 编写不同版本可能需要微调参数但核心逻辑是一致的{ 1: { class_type: LoadCheckpoint, inputs: { ckpt_name: 你的主模型.safetensors } }, 2: { class_type: CLIPTextEncode, inputs: { clip: [1, 1], text: masterpiece, best quality, a beautiful girl standing in ancient street, soft light, detailed face } }, 3: { class_type: CLIPTextEncode, inputs: { clip: [1, 1], text: lowres, bad anatomy, bad hands, text, error, worst quality, low quality, blurry } }, 4: { class_type: EmptyLatentImage, inputs: { width: 512, height: 768, batch_size: 1 } }, 5: { class_type: KSampler, inputs: { seed: 10086, steps: 25, cfg: 7, sampler_name: dpmpp_2m, scheduler: karras, denoise: 1, model: [1, 0], positive: [2, 0], negative: [3, 0], latent_image: [4, 0] } }, 6: { class_type: VAEDecode, inputs: { samples: [5, 0], vae: [1, 2] } }, 7: { class_type: ImageScale, inputs: { image: [6, 0], upscale_method: lanczos, width: 1024, height: 1536, crop: disabled } }, 8: { class_type: KSampler, inputs: { seed: 10087, steps: 25, cfg: 7, sampler_name: dpmpp_2m, scheduler: karras, denoise: 0.5, model: [1, 0], positive: [2, 0], negative: [3, 0], latent_image: [5, 0] } }, 9: { class_type: VAEDecode, inputs: { samples: [8, 0], vae: [1, 2] } }, 10: { class_type: SaveImage, inputs: { images: [9, 0], filename_prefix: highres_double_sampling } } }这里有一个细节要注意第二个 KSampler 的latent_image输入是第一个 KSampler 的 latent而不是放大后的图片像素。如果你把放大节点直接连到采样器会报类型不匹配的错误。正确的做法是第一个 KSampler 输出 latent → 解码成图片 → 放大图片 → 再通过 VAE Encode 把放大图片重新编码为 latent → 再接第二个 KSampler。上面这段 JSON 里我没有写 VAE Encode 节点所以严格来说这并不是一个“放大后重采”的完整链。实际使用时你需要在放大节点之后添加VAE Encode节点重新编码。为了便于理解这里给出正确的节点连接顺序第一次 KSampler → VAE Decode → Image Scale → VAE Encode → 第二次 KSampler → VAE Decode → Save Image很多高清放大插件节点如 Ultimate SD Upscale内部已经包含 VAE Encode 流程因此看上去是直接图片接采样器也可以本质是一样的。5.4 提示词写法建议文生图的质量除了工作流本身很大程度取决于提示词。建议按照下面的结构组织正面提示词质量词masterpiece, best quality, ultra-detailed, 8k wallpaper内容主体人物、场景、动作尽量用简单短语不要写复杂从句画风描述photorealistic, cinematic lighting, soft shadows或anime style, watercolor painting构图与镜头portrait, close-up, wide shot, depth of field。负面提示词不必写太多重点是bad anatomy, bad hands, worst quality, low quality, blurry, text, watermark。如果生成的图片文字乱码明显可以加text权重值例如(text:1.4)。提示词开头用惊叹符号并不影响生成质量ComfyUI 中的提示词节点是普通文本输入不需要额外转义。需要注意中英文混写的问题模型大多是英文训练的中文提示词效果偏差建议全部使用英文描述。你可以用在线翻译工具先把中文描述转成英文再粘贴进去。6. 从 AI 图片到 AI 视频本地视频生成工作流6.1 视频生成原理简述ComfyUI 生成视频并不是传统意义上的“拍摄”或“计算动画”而是基于视频扩散模型。简单说模型会接收一张起始图或者一组文本条件在潜空间里逐步预测并生成连续帧画面最终拼接成一个视频片段。按实现方式分类常见的视频生成路线包括图生视频Image to Video输入一张图片模型推断图片后续几秒的动态适合做“让静态照片动起来”的效果。文生视频Text to Video纯文本描述生成视频对模型和显存要求更高片段长度一般较短。视频修复/补帧对已有的视频进行超分、补帧、风格迁移需要配合 ControlNet 等节点完成。社区中对 ComfyUI 视频生成最常见的理解是用 AnimateDiff 或类似视频扩散插件在文生图工作流基础上增加时间维度把原本生成一帧的图像 latent 扩展成多帧序列然后统一解码输出 mp4 或 gif。这个过程涉及的节点比文生图要多一个“时间控制”的维度显卡显存不足时很容易崩。6.2 图生视频基础工作流要搭建一个基础图生视频工作流通常需要以下节点Load Checkpoint加载兼容视频生成的模型不同的视频插件对底模有要求Encode Image把输入图像编码到 latent 空间Video Model Loader插件提供加载视频扩散模型Video Diffusion Sampler生成多帧潜空间数据VAE DecodeVideo Output解码并导出视频文件。每一步之间依然靠连线传递数据整体流程和文生图很像但在 latent 张量上多出一个帧数维度。具体参数方面你需要关注frame_count生成帧数8 帧、16 帧、24 帧均可帧数越多显存占用越高fps视频帧率一般设置 8~12fps太高会导致动作跳动感明显denoise控制动态强度过高会让画面变化剧烈过低则几乎不动。第一次运行图生视频前建议先用视频插件自带的示例工作流测试。插件安装成功后custom_nodes目录下通常会有工作流示例文件。找到后打开按模板替换模型和输入图即可。如果你使用的是整合包里面大概率已经带了视频生成相关的插件和模型。打开接包文档或模型目录中的说明文件查看预置了什么模型选择对应的视频模型即可。6.3 视频输出参数与文件格式ComfyUI 的视频输出节点通常支持 mp4 和 gif 两种格式。视频节点导出时有几个参数值得注意filename_prefix输出文件名前缀format选择video/mp4时生成 H.264 编码的视频兼容性最好pix_fmt像素格式默认yuv420p兼容性最好fps视频每秒帧数建议 8~12。生成的视频保存在output目录下文件名带时间戳。如果你发现生成的视频体积过大可以降低帧率或者降低分辨率如果画面闪烁明显尝试增大帧数和降低 denoise 值。需要提醒的是本地视频生成对显存要求比文生图高一个档次。8GB 显存建议从 256x384 分辨率、8 帧开始测试12GB 以上可以从 512x768 分辨率开始。不要一上来就生成 24 帧 720p 视频大概率会显存溢出。6.4 文生视频的进阶配合 ControlNet 与 LoRA如果你的目的是“精确控制视频内容”单纯文生图视频很难满足需求。进阶玩法是引入 ControlNet 节点和 LoRA 模型ControlNet可以基于姿态、深度图、线稿图约束视频中每一帧的内容保证动作连贯且符合参考图LoRA低秩微调模型可以绑定特定角色外观、画风、服装风格让视频中的形象保持一致两个节点可以同时接入视频采样器一个负责控制动作结构一个负责控制外观风格。这部分属于进阶内容新手可以先跑通基础视频生成再逐步加控制。社区中大量视频工作流本质上都是“基础节点 插件节点 控图节点”的组合把握好这个框架后面看别人的工作流就会轻松很多。7. 常见问题与排查思路7.1 启动失败或浏览器无法访问问题现象常见原因解决思路双击启动脚本后窗口闪退Python 环境不完整或目录路径含中文检查目录路径改为英文重新解压整合包终端报No module named torchPyTorch 未安装或损坏使用整合包的重装依赖脚本或手动安装对应版本 PyTorch浏览器打不开http://127.0.0.1:8188服务未真正启动或端口被占用看终端日志启动到哪一步尝试换端口启动Mac 提示cannot open input file脚本没有执行权限终端执行chmod x 启动脚本.sh启动阶段的问题绝大多数出在环境完整度上。最好的解决方式是删掉整个整合包目录重新解压一次而不是手动修修补补。很多环境下一顿操作后的状态可能比重新解压更差。7.2 生成图片显存不足 OOM显存溢出是本地跑图最常遇到的高频问题。错误信息一般是CUDA out of memory. Tried to allocate 512.00 MiB排查顺序建议如下降低分辨率把Empty Latent Image的尺寸降为 512x512确认采样器中的batch_size是 1而非 2 或 4卸载不用的插件节点关掉后台其他占用显存的程序如果是双采工作流第一轮不要直接生成高分图第二轮 denoise 保持 0.5 以下在启动脚本中开启显存优化模式。整合包一般会在启动前询问是否使用--lowvram或--medvram低显存显卡建议选择--lowvram。显存不足的根源是资源分配不合理。通过降低分辨率、减少批次和合理设置 denoise多数问题都能缓解。如果仍然 OOM再考虑升级显卡或使用远端设备。7.3 生成图片模糊或结构崩坏如果你生成的人像出现手指变形、眼睛错位、画面模糊原因往往在提示词和采样参数上负面提示词不完整补充bad anatomy, bad hands, extra digits, missing fingerscfg 值过高过高的 cfg 会导致颜色过饱和、细节失真建议不超过 10采样步数不足SD1.5 模型低于 15 步时细节会产生明显噪点建议 25 步左右分辨率与模型不匹配SD1.5 建议在 512 附近生成SDXL 建议 1024 附近不要拿 SD1.5 直接生成 1024 大图。如果问题只出现在高清放大后说明第二次采样 denoise 值太高。把 denoise 从 0.7 降到 0.4~0.5细节会柔和很多。7.4 插件下载慢或节点缺失ComfyUI 大量功能依赖插件节点。如果你导入一个工作流后发现界面里出现大量红色节点说明插件没有安装。常见解决方法是先在菜单栏找到Manager插件ComfyUI Manager。如果整合包自带直接在 Manager 中点击Install Missing Custom Nodes它会自动从仓库安装缺失节点。国内网络环境下访问 GitHub 仓库可能极慢。建议的规避方式给 ComfyUI 配置国内镜像源整合包的启动脚本通常有“切换国内源”选项使用自定义镜像域名替换插件仓库地址但注意镜像源的时效性手动下载插件压缩包解压到custom_nodes目录然后重启 ComfyUI。插件安装完成后有些节点还需要额外安装 Python 依赖。重启启动脚本后看终端有没有相关依赖错误提示如果有就在终端里执行pip install 依赖包名补装。7.5 Mac MPS 后端无法使用Mac 用户使用 Apple Silicon 时PyTorch 通过 MPS 后端加速。如果你在终端看到MPS相关的报错通常是因为当前 PyTorch 版本太旧或者启动脚本中没有指定--use-mps。整合包 Mac 版启动脚本中一般会写python main.py --force-fp16 --use-mps如果 Mac 上使用的是 Intel 芯片性能确实不佳建议直接放弃本地视频生成改为文生图为主。M 系列芯片建议配合 16GB 以上统一内存12GB 以下内存的 Mac 运行大型模型会比较吃力。8. 最佳实践与工程建议8.1 统一工作流模板保存常用节点在实际使用过程中你会发现每次重新搭建节点非常耗时。建议把自己的常用工作流保存成模板文件文生图基础模板加载主模型 提示词 单次采样 保存高清双采模板双采样 放大 编解码图生视频模板基础视频采样 输出节点。在 ComfyUI 中点击菜单栏的Workflow → Save可以导出 JSON。把模板放在user/workflows目录下下次启动后直接在模板列表中打开。这样既减少重复工作量也方便复制给其他机型调参。8.2 显存优化与模型选择策略不同显卡适合不同精度的模型。8GB 显存建议使用 FP16 半精度模型同时开启--lowvram12GB 以上可以使用 BF16同时尝试加载多个插件节点。如果生成视频时频繁 OOM除了降低分辨率还可以把视频帧数拆成多个小批次生成最后用视频补帧合成虽然操作复杂度增加但能够在现有硬件上跑出更长片段。8.3 版权、素材和内容边界本地生成内容虽然不经过在线平台审核但仍然要注意素材版权和内容道德。具体来说用于训练的图片素材如果是公开版权作品要注意授权边界生成的视频如果用于商业用途建议先确认所用模型的使用许可不要生成涉及违法、暴力、虚假信息的内容本地工具不是“免责声明”。这一点并不是道德说教而是实际风险。有些模型许可证只允许非商业用途如果要做商业项目需要提前阅读模型卡说明。8.4 备份配置文件与自定义节点列表当你安装了大量插件、调整了启动参数后ComfyUI 目录会变得非常个性化。要迁移到新电脑时不一定要把整个目录拷贝过去只需要备份这几个部分custom_nodes目录下的插件清单user目录下的工作流模板和配置启动脚本中的自定义参数models目录下的模型整理清单。写一份docs/README.md放在项目目录里记录你安装了哪些插件、从哪里下载、以及每个工作流的作用对后续维护帮助非常大。8.5 生产环境下的批量生成技巧如果你的目标是批量生成大量图片或短视频例如做相册幻灯片、素材库搭积木建议注意这几点使用批处理节点把多张输入图放到同一批次中计算减少模型反复加载的开销固定随机种子时可以通过修改种子批量生成变化图方便筛选输出到独立目录按日期和内容分类便于长期管理素材生成过程中不要频繁切换工作流每切换一次模型读盘和加载都要消耗时间。9. 如何进一步学习与进阶方向到这里你已经理解了 ComfyUI 文生图和视频生成的核心逻辑节点化工作流、双采样放大策略、显存优化思路、插件安装方式。下一步如果想深入学习可以按下面的顺序推进第一步掌握标准图生图与局部重绘文生图只是第一步。图生图能让你把一张草图或参考图转成不同风格局部重绘能修复图片中局部缺陷。这两个能力在生产素材时非常实用。第二步读懂 ControlNet 工作流ControlNet 是精确控制画面的钥匙。用姿态、深度、线稿来控制生成可以让生图从“碰运气”变成“受控创作”。这也是视频工作流的基础。第三步学习 LoRA 训练当默认模型不能满足你的风格需求时LoRA 是目前最轻量的个性化微调方案。在一张 4090 上用十几个训练集图片就能训出可用的 LoRA可以固定在角色形象、物体外形或画风上。第四步研究视频生成模型视频生成是 AI 视觉领域迭代很快的方向ComfyUI 社区通常会把新模型快速做成节点。每隔一段时间检查你使用的整合包更新日志跟着升级插件和模型避免停留在老版本上。第五步参与社区工作流分享社区中大量工作流都是免费分享的。你可以下载别人的成品工作流拆解每个节点的作用理解它为什么要这样连接然后再结合自己的需求改造。看十个高赞工作流比闷头生成一百张图学得更快。本地生成 AI 视频的乐趣在于整个链路都在自己手里从模型选择、工作流设计到参数调整每个环节都可以反复试错和优化。只要搭好环境和基础工作流这套能力就能变成你自己的素材生产线。对于刚开始接触 ComfyUI 的朋友我的建议非常简单先跑通默认模板再改一个参数观察效果多试几次整套逻辑自然会清晰起来。如果本文对你有帮助可以收藏备用也欢迎在评论区聊聊你遇到的具体报错和奇怪的生成现象。
返回列表