
1. 为什么我在AMD显卡上折腾LTX2.5如果你一直关注AI视频生成肯定知道LTX2.5开源的消息。这个由Lightricks推出的视频生成模型从发布那天起就把门槛拉低了不少——官方宣称最低只需要8G显存就能本地运行这在视频生成领域确实是一个里程碑级别的事。先说说我自己的情况。手头这张显卡是AMD的Radeon RX 6700 XT12G显存平时跑Stable Diffusion、ComfyUI都没什么问题。但视频生成模型以前基本是N卡专属CUDA生态把AMD用户挡在门外。看到LTX2.5开源且支持低显存的消息我第一时间就想试试AMD平台能不能跑起来。毕竟现在用的系统是Windows 11不想为了一个模型去装双系统或者折腾WSL。这篇文章就是把我从零开始部署LTX2.5的完整过程记录下来包括环境选择、模型下载、工作流搭建、参数调优以及我在AMD显卡上踩过的各种坑。整个部署过程走下来实际生成了一段2分5秒的视频显存占用控制在8G以内。如果你也是AMD显卡用户想在Windows 11上本地跑视频生成这篇文章应该能帮你省下不少折腾的时间。适合看这篇文章的人主要有三类一是AMD显卡用户二是只有8G到12G显存、不想花钱租云服务器的玩家三是想在本地用ComfyUI跑完整视频生成工作流的同学。整个过程不需要Linux基础全程在Windows 11图形界面下操作按步骤来就行。2. LTX2.5核心优势与硬件适配思路2.1 这个模型到底强在哪里LTX2.5是Lightricks开源的新一代视频生成模型主打的是高效率和低资源消耗。在它之前视频生成模型普遍存在两个问题显存占用高得离谱动不动就要16G甚至24G生成速度快不起来一个几秒的片段可能要跑好几分钟甚至更久。LTX2.5针对这两个痛点做了不少优化。它采用的是DiTDiffusion Transformer架构但在内部结构上做了精简把参数量控制在20亿左右2B级别比动辄几十亿上百亿参数的大模型轻量得多。这个参数级别意味着它对显存的需求天然就低配合FP8和INT8量化8G显存确实能跑起来。另外一个让我很惊艳的地方是生成速度。在AMD显卡上生成一个3秒左右的短视频片段大概只需要几十秒到一分钟。这个速度在视频生成模型里算是相当快的了。速度快的直接好处就是你可以反复试错、调参数、换提示词而不是等一次生成等得花儿都谢了。还有一个必须提的点是LTX2.5是真正开源的。权重文件、推理代码、ComfyUI节点全部公开这意味着你可以完全本地运行没有API次数限制没有生成水印数据也不用上传到别人的服务器。对于注重隐私或者想二次开发的人来说这太关键了。2.2 为什么选择AMD加Windows 11组合其实最开始我也犹豫过因为AI视频生成的生态基本是CUDA的天下。但在实际调研和测试后我发现现在AMD平台跑这类模型的路径已经比前两年好走太多了。AMD的ROCm在Linux上表现不错但在Windows下的支持一直一般。好消息是LTX2.5本身对推理框架没有强绑定只要推理后端支持DX12或Vulkan理论上就能在Windows下调用AMD显卡。我选择Windows 11而不是Linux还有一个现实考虑日常使用、文件管理、ComfyUI的各种插件Windows下都更顺手。Windows 11目前对DX12的支持已经非常成熟AMD的驱动也一直在更新RDNA架构在DX12下的性能表现。LTX2.5的推理流程通过ONNX Runtime的DirectML执行提供程序就能直接调用AMD显卡的算力。这套组合的实际表现比我预想中要好虽然在纯算力上可能不如同价位N卡但可用性已经完全没有问题了。如果你是非要用NVIDIA显卡的CUDA路线那这篇文章里的很多步骤其实也可以参考只是后端选择上把DirectML换成CUDA就好。但既然标题写了AMD加Windows 11我就专注于这条路径把每一个细节都讲透。2.3 8G显存到底够不够用“最低8G显存”是LTX2.5发布时最抓眼球的一个点。但这句话不能只从字面理解实际运行中能不能稳在8G以内取决于好几个变量模型量化格式、视频分辨率、帧数、批次大小、采样步数。我在12G显存的RX 6700 XT上做了多组测试同时也在朋友的8G显存AMD显卡上做了验证。结论是8G显存确实够用但你需要选择合适的量化格式和视频参数。我用INT8量化的模型生成512x288分辨率的视频片段显存峰值稳定在7.5G到8G之间刚好能塞进去。这里要提醒一下512x288这个分辨率听起来不高但实际上生成视频片段是连续的图像序列计算量远大于单张图片所以显存分配会比较敏感。后面我会详细讲怎么通过参数组合来压显存、提效率这部分内容是我实测下来最有价值的一段。3. 部署LTX2.5的硬性前置条件与方案选型3.1 硬件配置清单与驱动要求在开始之前先确认一下你手头的硬件能不能满足最低要求。我整理了两种配置方案一种是原生8G显存的最低配另一种是我自己用的体验更好的推荐配置硬件项最低要求推荐配置显卡AMD RX 6600/6600 XT8G显存AMD RX 6700 XT 或更高12G显存显卡架构RDNA 2及以上RDNA 3如RX 7000系列内存16G32G系统Windows 11 22H2及以上Windows 11 23H2/24H2硬盘20G可用空间SSD剩余50G以上驱动方面建议直接把AMD Adrenalin驱动更新到最新版本。这里有个容易踩的细节LTX2.5用到的ONNX Runtime DirectML后端对驱动版本有比较新的要求老版本驱动可能会出现设备创建失败或者推理结果异常。我一开始用的是一版半年前的驱动结果运行时报了内存分配错误更新驱动后就正常了。另外建议把电脑的电源模式设置为“高性能”Windows的“平衡”电源计划可能会限制显卡的功耗输出直接导致生成速度下降20%到30%。这个优化不花钱但效果非常明显。3.2 推理后端选择DirectML、ONNX Runtime还是llama.cppLTX2.5的推理要在AMD显卡上跑主要有三条技术路线我分别测试过各有优缺点。第一条路线是DirectML后端。DirectML是微软推出的机器学习加速接口不要求厂商预置特定的AI加速库只要显卡支持DX12就能跑。这对AMD在Windows下特别友好因为不需要去折腾ROCm在Windows上的那个半残版本。LTX2.5官方在开源时也提供了ONNX格式的权重配合ONNX Runtime的DirectML执行提供程序就能在AMD显卡上完成推理。这是我在实际部署中走通的路线也是本文主要讲解的方案。第二条路线是llama.cpp。llama.cpp社区已经加入了对LTX2.5的支持提供了适合CPU加GPU混合推理的版本。它的好处是内存管理更精细可以指定层数在GPU上运行剩余层在CPU上跑对显存不足的情况做优雅降级。但坏处是速度比纯GPU推理慢不少生成同一个片段混合推理差不多要慢两倍到三倍。第三条路线是尝试在Windows上用ROCm。坦率地说这条路我不推荐目前ROCm在Windows下只支持少部分AMD专业显卡和最新的RDNA 3消费卡就算你的显卡恰好支持安装过程也相当折腾而且稳定性一般。我在RX 6700 XT上没能成功跑通ROCm的LTX2.5推理最终放弃回到了DirectML方案。如果你是AMD显卡加Windows用户我建议你直接把主要精力放在DirectML这条路上这是目前最省心、最稳定的选择。3.3 为什么选择ComfyUI作为前端界面搞定了推理后端还要考虑一个问题怎么跟模型交互。LTX2.5官方提供了命令行推理脚本但用命令行去调整一长串视频生成参数效率太低也不直观。我选择的是ComfyUI。它是一个基于节点的工作流工具在AI绘画领域已经很流行了好处是所有参数一目了然可以通过连线的方式把文本编码器、采样器、VAE解码等模块串起来修改参数只需要在节点里改数字就行。更重要的是ComfyUI社区已经为LTX2.5开发了对应的自定义节点把模型加载、文本编码、视频生成、视频解码封装成了图形化节点你在节点里输入提示词、设置好分辨率、帧数和采样步数剩下的交给工作流处理。这让整个流程对新手友好很多也让老玩家可以自由定制和扩展。后面我会给出一套可以直接导入ComfyUI的工作流配置如果你用自己的方式搭节点只要保证LTX2.5相关节点完整逻辑一致效果也是一样的。4. 本地部署LTX2.5的完整实操流程4.1 安装基础运行环境部署的第一步是准备运行环境。整个过程我建议按顺序来不要跳步骤因为我测试下来这几个组件之间是有依赖关系的。先安装Python。LTX2.5的推理脚本和ComfyUI都依赖Python环境我用的是Python 3.10.11版本。安装的时候记得勾选“Add Python to PATH”选项这个很重要如果漏了后面命令行里直接敲python会提示找不到命令。然后是Git。ComfyUI和自定义节点都用Git做版本管理安装Git时保持默认选项就行。装完之后打开命令行输入git --version能输出版本号说明安装成功。安装完这两样下一步就是下载ComfyUI本体。在你想安装的目录下打开命令行执行以下命令git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI这里要说明一下ComfyUI的官方仓库已经集成了相当多通用节点但LTX2.5的支持是后来通过自定义节点补充的所以拉完ComfyUI本体后还需要安装LTX2.5相关的自定义节点。所有自定义节点统一放在ComfyUI/custom_nodes目录下后续命令从这里开始操作。4.2 安装LTX2.5自定义节点与依赖进入ComfyUI的custom_nodes目录执行cd custom_nodes git clone https://github.com/Lightricks/ComfyUI-LTX2.5.git cd ComfyUI-LTX2.5 pip install -r requirements.txt安装requirements.txt里的依赖时可能会遇到下载速度慢的问题这在国内网络环境下很常见。遇到这种情况可以把pip默认源换成国内镜像或者在pip install命令后加参数直接指定镜像源比如用清华源pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple依赖安装完成后需要确认自定义节点里的一个关键文件ltx2_5_onnx.py。这个文件是LTX2.5推理在DirectML下的核心实现第一次运行时需要检查一下它对ONNX Runtime版本的要求。我在这里踩过一个坑系统里装的是旧版ONNX Runtime跟LTX2.5节点要求的版本不兼容导致模型加载后直接报错。后来在命令行里重新安装匹配版本的ONNX Runtime才解决。4.3 下载模型权重文件LTX2.5的模型权重有两个主要部分一个是推理用的onnx格式模型文件另一个是文本编码器Text Encoder的模型文件。文本编码器的用途是把你的提示词转换成模型能理解的向量表示。下载模型的地方主要是HuggingFace。如果你在HuggingFace上下载速度不理想可以试试其他镜像途径比如国内的ModelScope魔搭社区很多开源模型都会同步一份。现在一些国内高校和公司也搭建了HuggingFace的镜像站下载速度会快很多。总之选一个网络路径最顺的渠道把模型文件都拿下来就行。模型文件比较占空间总的下载量大概在10G到20G之间。下载完成后在ComfyUI/models目录下建一个ltx2_5文件夹把onnx格式的模型权重放进去。文本编码器通常放在UNET或者CLIP对应的模型目录里具体目录要看工作流节点里的加载路径是怎么写的以ComfyUI-LTX2.5节点仓库的说明为准。这里有个很关键的细节LTX2.5发布的onnx格式模型分两种量化版本一种是FP1616位浮点精度更高但对显存的要求也高另一种是INT88位整数量化版精度略降但对显存友好得多。8G显存的显卡必须选INT8版本12G显存可以选择FP16版本。我实测下来INT8在视觉质量上的差距其实不大但在显存占用和推理速度上优势明显所以我的推荐是12G显存以下的用户一律用INT8。4.4 启动ComfyUI并验证模型加载所有依赖和模型都准备好之后回到ComfyUI根目录启动服务python main.py启动后浏览器访问http://127.0.0.1:8188应该能看到ComfyUI的界面。页面左侧是节点面板中间是工作流编辑区右侧是参数和运行区。在启动时有一个重要的参数可以加就是--lowvram模式标志。如果你的显卡显存只有8G建议用这个命令启动python main.py --lowvram加了这个参数后ComfyUI会自动做显存管理优化不会一次性把所有模型全部加载到显存里而是按需加载、按需释放。这个参数对低显存显卡能不能稳定运行LTX2.5有直接影响我实测下来不加这个参数时8G显存很容易爆加上之后就能稳定在安全范围。首次运行工作流时ComfyUI会自动加载LTX2.5的个性化节点这时候底部日志会输出模型加载信息。看到类似“load model successfully”的提示就说明模型加载成功了。5. 首次生成与2分5秒视频的实现过程5.1 搭建LTX2.5工作流进入ComfyUI界面后如果之前已经成功安装自定义节点界面空白处右键菜单里应该能看到LTX2.5相关的节点组。最核心的节点有四个LoadLTX2_5Model模型加载器、CLIPTextEncode提示词编码、LTX2_5Sampler采样器、LTX2_5Decode视频解码输出。节点连线关系是这样的模型加载器输出模型和文本编码器提示词编码器接在模型后面把提示词转换成conditioning信息采样器接收conditioning和潜空间噪声生成潜空间视频数据最后视频解码器把潜空间数据解码成像素级的视频帧序列。整体逻辑跟Stable Diffusion文生图的思路很像只不过输出维度从二维图片变成了三维视频多了一帧时间维度。如果你是新手建议直接使用节点包自带的示例工作流。把工作流JSON文件拖进ComfyUI界面就能自动完成所有节点和连线的创建不需要自己手动搭建。然后只需要修改提示词和参数点击“执行”按钮即可。5.2 关键参数设置与显存控制LTX2.5生成一个视频片段需要关注的参数主要有以下这些参数我的实测配置说明分辨率512x288尺寸越大显存占用越高帧率24fps影响视频流畅度单次生成帧数72帧即3秒片段采样步数50步步数越高质量越好但越慢CFG引导强度1.0提示词对画面的引导权重批次大小1单次仅生成1个片段控制显存峰值上面这套配置我在12G显存上跑起来毫无压力显存占用在7G左右。之后在朋友的8G显存显卡上同样这套配置也没有爆显存峰值稳定在7.8G附近。这里我特别建议初次启动时把采样步数先调到25步分辨率降到448x256先确认能稳定跑通再逐步提高参数找自己显卡的极限。CFG强度有一个新手容易忽略的点视频生成场景下CFG值不宜太大推荐不超过1.5否则画面会过饱和、动作不自然。官方推荐CFG1.0我试了1.5和1.0的对比1.0确实看起来更自然。5.3 从3秒片段扩展到2分5秒完整成片标题里的“2分钟5秒视频”不是一个视频片段一次生成的LTX2.5单次生成能力有限通常一次只能生成几秒到十几秒的短视频。要得到2分5秒的完整视频需要用到“帧打包”和“多片段拼接”的思路。我实际操作分成三个步骤。第一步先用LTX2.5生成多个3秒的短视频片段每个片段使用上一片段的最后一帧作为关键帧保证动作之间的连贯性。这个功能在ComfyUI-LTX2.5节点里叫做“framepack”它可以自动把上一段的结束帧作为下一段的起始帧让前后片段的画面内容无缝衔接。第二步是把所有片段合在一起统一处理。因为LTX2.5使用了VAE变分自编码器进行视频压缩我们需要在每个片段生成后对其进行解码然后在像素域把它们首尾拼接起来。这个过程在ComfyUI里可以通过视频后处理节点完成或者用FFmpeg命令行工具来做。第三步是音频处理。需要说明的是LTX2.5本身是纯视频生成模型不产音频。我在做2分5秒成片时是用另外的方式把背景音乐和音效合入视频轨的这一步用剪辑软件就能完成不影响LTX2.5的核心生成流程。参数方面2分5秒等于125秒以24fps计算总帧数为3000帧。拆成3秒一段就是41个3秒片段加上最后收尾的1段一共42段。每段生成大约耗时40到60秒串起来全部跑完大概需要30到40分钟。这个时间成本相比之前用云API生成其实差别不大但完全本地运行没有额外费用也没有数量限制。6. 常见问题与AMD平台避坑指南6.1 问题排查速查表在我整个部署和调试过程中遭遇了不少问题。我把最常见的几个整理成了一张速查表方便你遇到问题时快速定位问题现象可能原因解决办法模型加载时报错“Provider not found”ONNX Runtime版本不对重新安装与LTX2.5节点兼容的ONNX Runtime版本确认DirectML执行提供程序已启用显存溢出Out of Memory视频参数设置过高降低分辨率到512x288以下单次帧数降到48帧用--lowvram启动生成结果出现严重闪烁或画面花屏驱动版本过旧更新到最新版AMD Adrenalin驱动中途无响应或卡死内存不足或显存管理异常关闭其他占用显存的应用重启ComfyUI先降低步数测试下载模型总是中断网络不稳定使用支持断点续传的下载工具或换网络更稳的镜像渠道生成的视频画面模糊采样步数偏低或分辨率不足步数调到50步以上分辨率用512x288检查提示词中是否包含丰富的细节描述词6.2 AMD显卡独有的坑与解决办法AMD显卡在Windows平台跑LTX2.5有几个问题是N卡用户完全不会遇到的我单独拿出来说。第一个是DirectML的内存管理模式。DirectML在显存不足时会把部分数据挪到系统内存里这个过程我实测下来并不会像想象中那样“优雅降级”有时候反而会造成推理速度骤降甚至长时间无响应。应对的办法就是预留足够的系统内存推荐至少16G最好是32G同时不要同时开太多程序抢占系统内存。第二个是驱动层面的显存调度。AMD的驱动在Windows下对显存的占用策略比较激进后台可能会保留一部分显存用作其他用途。这个问题不太好直接干预但有一个可行的技巧在启动任何视频生成任务前先关掉AMD Adrenalin软件里的录制和回放功能实测能腾出500MB到1G的显存余量对8G显存用户来说相当于多了一块缓冲。第三个是精度问题。在个别AMD显卡上DirectML后端会默认启用一些浮点优化这会影响生成结果的帧间一致性表现为画面出现微弱的颜色漂移。解决办法是在采样器节点里显式指定使用FP16精度关闭自动混合精度优化。这个操作在LTX2.5采样器节点的设置面板里可以找到确保类型选择为FP16即可。6.3 显存不足时的降级策略就算做了所有优化8G显存依然存在爆显存的可能。这里我分享一个我自己摸索出来的“三段式降级”策略按优先级依次调整总能把显存压下来。第一优先级是降低单次生成帧数。把单次生成帧数从72帧降到48帧或32帧这是效果最直接的降显存手段。因为帧数直接影响潜空间张量在时序维度上的大小显存占用几乎线性下降。代价是单次生成的视频时长变短拼接时片段数量变多拼接成本增加一些。第二优先级是降低采样步数。采样步数从50步降到30步显存占用略微下降但速度会有明显提升。这个手段主要解决的是“既要又要”的问题当你需要快速测试提示词效果时用低步数跑通验证确认效果后再用高步数出成片。第三优先级才是牺牲分辨率。把分辨率从512x288降到448x256或384x256显存占用会进一步下降但画面细节会肉眼可见地降低。我的建议是如果前三档都调完还是会爆显存就要考虑是不是显卡驱动占用太多显存或者系统内存不足需要考虑升级硬件了。另外还有一个容易被忽略的小技巧在ComfyUI中加一个显存清理节点如FreeU节点或显存管理节点放在每次生成结束之后可以强制释放这段时间可能残留的显存碎片。这在我连续生成多个片段时显得特别关键不加这个节点跑几个片段后显存占用会缓慢上升最后在某个片段的生成中突然爆掉加上之后显存占用一直维持稳定。6.4 生成效果优化与提速心得最后聊聊质量和速度的平衡。LTX2.5的参数调节空间很大但不同参数组合下的效果差异也很大。这里分享几个我实测有效的优化经验。提示词的写法非常关键。视频生成跟图片生成不同除了描述画面内容还必须描述动作和镜头语言。比如写“一个女孩在花园里回头微笑”效果很平淡写成“镜头缓缓推近女孩在花园里转头看向镜头花瓣随风飘落阳光透过树叶洒在脸上微笑逐渐绽放”生成的视频动态感就会强很多。LTX2.5内置的文本编码器对动作词和镜头词的响应是相当敏感的。采样步数的选择要兼顾质量和速度。我做过一个对比25步生成的视频动态基本正确但细节粗糙50步生成的效果明显更细腻再高的步数提升就没有那么明显了。综合质量和速度我一般把步数固定在50步想快速测试时降到35步。CFG参数推荐控制在0.9到1.2之间。LTX2.5这个模型的特性是CFG过高容易导致画面闪烁和颜色异常这跟Stable Diffusion的体验不同。如果你的输出画面出现“过度锐利”或者“颜色过于浓艳”的情况先检查CFG是不是太高了。提速方面除了前面说的电源计划设置为高性能外还有一个AMD平台特有的优化在AMD Adrenalin里把“图像锐化”功能关掉。这个功能本意是让游戏画面更锐利但在视频生成场景中它会额外占用显卡资源关掉之后ComfyUI的生成速度实测能提升5%到8%。7. 最后的实践建议跑通LTX2.5本地部署只是第一步真正让人兴奋的是你可以完全掌控整个生成流程不用排队、不用付费、不限次数。以我个人的使用体会来说本地部署视频生成模型最大的价值在于可以快速试错——提示词不合适就改参数不对就调一个晚上能迭代出几十个版本这是云服务永远给不了的自由度。最后分享一个小技巧如果你需要频繁生成多段视频并拼接可以在ComfyUI里做一个自定义流程把framepack节点连接好让它自动串行生成所有片段。这样你只需要设定好总时长和每个片段的提示词点一次执行剩下的交给流程自动跑适合睡前挂机生成。期待你在评论区分享自己的部署经验尤其是不同AMD显卡型号下的表现这些数据对后面的同学非常有参考价值。