
数字人直播和数字人口播最近问的人确实很多。很多人一上来就搜“免费数字人制作工具”结果要么下载一堆要付费的软件要么导出带水印要么做出来口型对不上最后连一条 60 秒口播都没跑通。这篇我尽量把从形象、声音、文案到生成数字人视频再到搭建直播间推流的整个流程拆细一些让普通电脑环境下也能先做出一条能看的数字人口播再把直播间架起来。适合谁看想做出镜口播但不想露脸的人想低成本测试数字人直播的人以及被各种付费工具绕晕的新手。我会先讲链路再讲准备然后分视频制作和直播间搭建两条线走最后补一份排查清单。这样你既能复现单条口播也能理解直播场景里到底需要哪些环节。1. 先搞懂数字人视频和数字人直播是两个链路很多教程把“数字人视频”和“数字人直播”混在一起讲。实际上它们是两条链路虽然素材可以复用但处理逻辑完全不同。1.1 数字人视频制作解决“一个人也能批量产出出镜口播”数字人视频的核心是“先有文案再生成一张会说这段文案的虚拟形象画面”最后和音频、字幕一起合成视频文件。它的使用场景一般是短视频口播、产品介绍、课程讲解、企业宣传片。这个流程适合批量化。只要文案准备好了就可以在同一个数字人形象下批量生成多条口播视频然后导入剪辑软件加字幕、背景音乐和片头片尾。所以它更适合“内容工厂”式的用法。但要注意批量生成不等于无脑生成。平台免费额度、生成排队、单条时长限制都会影响产量。我给的建议是先做一条跑通流程再谈批量。1.2 数字人直播解决“固定时段持续开播”数字人直播不是生成一个视频文件就结束而是要让虚拟形象在直播间里持续说话、动作并真实推流到直播平台。它解决的是“人不能一直出镜但又想保持开播时长”的问题。这里面有几个关键环节数字人形象画面可以是一个预先渲染好的视频源也可以是实时驱动的模型。音频来源可以是提前准备好的轮播文案也可以是实时语音合成或真人实时配音。推流工具把画面和音频输出到直播平台一般通过“虚拟摄像头直播软件”或“直接推流地址”完成。直播链路更考验资源稳定性。因为视频制作可以等生成慢就多等一会儿直播不行直播一旦卡顿、断流、音画不同步观看体验立刻变差。1.3 免费工具到底能免费到什么程度这个问题先要说清楚不然后面会踩坑。“免费数字人制作工具”通常分三类网页端数字人平台有免费额度但一般限制视频时长、分辨率、生成次数导出可能带水印。开源本地部署方案代码免费但需要自己准备显卡、环境和模型技术门槛更高。直播伴侣或剪辑软件内置功能一部分工具内置数字人口播能力使用时需要看当前版本是否开放免费入口。我建议新手优先用“在线免费额度 剪辑软件合成”的方式做数字人短视频用“开源本地部署或在线数字人直播源 推流软件”的方式做数字人直播。不要指望一个工具从头到尾全免费、无限制这不现实。2. 开始把素材和运行环境准备好无论做视频还是直播都要先准备三样东西数字人形象、口播文案、声音。这三样没准备好后面操作再多都白搭。2.1 形象、文案、声音三件套数字人形象有几种来源平台内置形象很多数字人制作平台自带一批人物形象选择后直接输入文案即可生成。自己上传照片生成部分平台支持上传一张正面照片然后生成一个类似的数字人形象。注意这里要使用你有权使用的照片不能随便拿别人的照片做数字人。本地模型驱动开源方案里可以用一张静态图配合音频驱动口型和动作适合技术能力更强的用户。口播文案是数字人视频的“唯一输入”。我平时会按这个模板准备开头各位朋友今天聊一个很多人问的问题。 中间先讲是什么再讲怎么做最后讲要注意什么。 结尾如果你准备试先从小样本开始跑通再放大。文案不要太长。一条 60 秒口播大约 200 到 260 字之间已经很合适。超过 3 分钟的长视频建议拆分多条不然生成排队和音频不同步的概率都会上升。声音这块有两种常见做法用平台自带音色快速、稳定、不需要额外授权。用自己的声音克隆需要先录制 1 到 2 小时的高质量干声素材并且要确保你有权使用这一段声音。别人的声音、公众人物的声音不能随便拿来克隆和商用。这里多说一句声音授权是很容易忽略的坑。自己录声音没问题但如果你在网上找了一段音色做克隆然后发布到视频平台一旦原声音所有者投诉视频会被下架账号也可能受影响。2.2 普通电脑能不能跑看三个指标经常有人问“我的电脑能不能做数字人”。先别急着买显卡看三个指标内存至少 16GB32GB 会更稳。内存不够时本地模型加载会直接报错或进程被系统杀掉。显卡显存如果是本地部署音频驱动图片数字人这类方案6GB 显存可以做低分辨率测试8GB 以上更舒服。如果完全用网页端生成显卡不是硬需求。磁盘空间数字人模型动辄几个 GB加上 Python 环境和各种依赖预留 20GB 以上比较稳。低配置能跑通一条视频不代表适合批量处理。同样的操作在 8GB 显存机器上跑 1 分钟素材可能没问题但连续跑 20 条就会出现显存溢出。这时候不要开最大并发一条一条跑或用在线平台生成。2.3 工具选型网页生成、开源本地、直播伴侣我把常见工具方向整理成一张表方便你按自己的情况选使用方式适合人群门槛输出质量典型注意事项网页端数字人平台新手、内容批量生产低中上免费额度有限导出可能有水印或时长限制开源本地数字人项目技术爱好者、二次开发高取决于模型和参数环境配置复杂显存要求高版本迭代快剪辑软件内置数字人只需要简单口播低中每个版本开放度不同需要看当前功能入口开源直播助手项目想跑数字人直播中高中上需要处理推流、音频、客服话术等多套接口我的判断是追求效率选网页端想要可控性和长期低成本选开源本地方案临时试水先用剪辑软件内置功能。最忌讳的是同一个需求换了三个工具每个都用三分钟就判定“不好用”。给自己定一个标准先跑通一条视频再评断工具。3. 数字人口播视频的完整制作流程这一节讲清楚从文案到成片应该怎么操作。核心顺序是单条跑通 - 检查质量 - 批量生产。3.1 先用一条最短文案跑通全流程第一次做不要直接上 3 分钟长文案。建议先选一段 30 秒以内的口播文案大概 100 到 150 字。原因是短文案生成快出问题容易定位而且平台免费额度往往对单条时长有要求短文案不容易触发限制。具体流程如下准备好文案复制到文本文件编码最好用 UTF-8。Windows 用户容易在复制中文时出现编码问题导致生成乱码所以不要直接在记事本里粘贴大段内容最好先另存为 UTF-8 格式。选择数字人形象建议先用平台默认形象不要一上来就追求个性化。选择音色先用普通女声或男声不用调整语气参数默认参数跑通。生成视频等待进度条完成。下载生成的视频文件检查口型、声音、文案是否一致。跑通之后你才算真正知道这个工具长什么样。如果你一上来就调参数、换形象、换背景出问题时很难判断是哪一步出了问题。3.2 批量生成时重点管好命名、队列和输出目录能做单条之后很多人会马上开始批量生产。这里我建议先设计一个规范不然几十条视频生成后文件名乱成一团根本没法剪辑。我的批量生成习惯是这样的每条文案一个独立文本文件文件名用“日期_主题_序号”格式例如“20250601_口播_001.txt”。生成视频导出后统一命名成“日期_主题_序号_主播名.mp4”。建一个目录“output”下面再分子目录“done”和“failed”。成功的放进 done失败的放进 failed。生成记录保存成一个表格包含文案路径、生成时间、导出时间、状态、失败原因。为什么要这样做因为数字人平台生成是异步的。你提交 20 条任务可能 10 条成功、5 条排队、5 条失败。没有记录表你根本不知道哪条失败了、为什么失败。代码层面如果你会脚本可以用类似这样的流程逻辑for each text file: 提交任务 等待生成 检查任务状态 如果成功下载视频到 done 如果失败记录原因到 failed 每隔 5 秒检查一次注意这里我说的是流程逻辑不是某个平台专用代码。不同平台的 API 差别很大一定要以官方文档为准。批量任务最怕的不是慢而是失败后没有重试机制。建议先跑 5 条测试确认平台稳定后再全量提交。3.3 成片检查口型、音频、字幕、背景四层核对很多数字人口播视频的问题不是生成时就能看出来而是在剪辑导出后才发现。所以成片检查要按固定顺序看口型逐句眼听重点看数字人说话时口型是否和音频对得上。口型对不上通常是文案和音频不匹配或生成时音画同步出现偏差。音频检查是否有爆音、底噪、音量忽大忽小。网页工具生成的音频一般相对干净但本地 TTS 容易在长句中出现“吞字”。字幕如果你用剪辑软件自动生成字幕要核对标点和断句尤其是专业术语和人名。背景数字人形象周围是否有边缘锯齿、绿边、半透明残影。如果有说明抠图或合成参数需要调整。检查时可以做一个表格每条视频记录四个维度是否通过。不要相信“一眼看着没问题”要真的把视频从头到尾播放完。60 秒的视频你就老老实实看 60 秒。如果视频里有口型对不上不要急着重新生成整条。先看文案是否有同音字问题例如“账号”和“帐户”音频可能读成另一个音。这时候修改文案比调整生成参数更有效。4. 数字人直播间的搭建步骤数字人直播比短视频制作复杂一点但只要把链路拆开也不算难。核心链路是数字人画面源 - 音频源 - 推流工具 - 直播平台。4.1 最简单的搭建方式视频源 直播推流如果你不需要实时互动只需要数字人不断播报最简单的方式是用数字人工具生成一个较长的循环视频例如 10 分钟到 30 分钟的口播视频。在电脑上循环播放这个视频。用 OBS 或同类推流软件把该视频窗口作为“窗口捕获”或“媒体源”加入场景。设置直播平台推流地址点击开始推流。这里要多说一句不要用“本地视频循环播放”冒充“真人实时直播”。数字人直播在不少平台有明确的标识要求或规则限制开播前先看平台对应规定。我教你的是技术搭建能否在某平台使用以平台规则为准。这种方式的优点是简单、稳定不依赖实时 AI 生成。缺点是互动性差观众评论得不到回应。适合商品介绍、知识讲解、预告轮播这类场景。4.2 进阶实时语音驱动的数字人直播如果希望直播间能播放不同文案或者支持文字转语音实时发声可以走进阶方案数字人实时驱动把对话文案推给数字人引擎由引擎实时生成语音和口型。音频输出到虚拟声卡把电脑声音输出到虚拟音频设备再在 OBS 里选择这个音频源。画面通过虚拟摄像头或窗口捕获进入 OBSOBS 再把整个场景推流到直播平台。这类方案的问题在于延迟和资源占用。实时驱动意味着每一句话都要经过“文本 - 语音 - 口型 - 渲染”这串流程任何一环慢了直播间就会卡顿。所以要先测延迟不要一上来就长时间开播。如果你用本地开源模型做实时驱动建议先看显卡占用。连续开播一小时显卡温度、显存占用、风扇噪音都是需要观察的指标。没有稳压能力不如先用轮播视频。4.3 绿幕、背景、音量和试播检查数字人直播的画面质量往往不在数字人本身而在场景和声音设置。如果数字人形象是绿幕背景需要在 OBS 里添加“色度键”滤镜去掉绿色背景。背景图或背景视频放在数字人图层下方。音量控制在 -6dB 到 -3dB 之间不要一直顶到 0dB。推流分辨率建议先用 1080p 30 帧码率根据上传带宽调整常见环境可以先用 3000 到 4500 Kbps 测试。正式开播前一定要做一次试播检查。试播时开一个小号或直接录屏跑 10 到 15 分钟确认以下内容画面清晰无撕裂、花屏。音频和画面同步无回音。数字人口型与播放文案匹配。观众端能正常看到画面而不是黑屏或低帧率。试播的目的不是追求完美而是提前发现“音画不同步”“绿幕没抠干净”“声音太小”这类问题。5. 高频问题排查从现象到根因数字人相关的报错和问题看着五花八门其实大多集中在几个环节。我按排查顺序整理一张表现象优先排查环节具体检查点口型对不上输入文本和音频文案是否有同音字音频是否完整生成时文案是否被截断声音和画面不同步视频渲染/推流本地播放是否正常OBS 里音频偏移参数是否被调整生成视频一直排队平台免费额度免费额度用完了或当前时段高峰排队本地模型加载报错环境依赖Python 版本、显卡驱动、显存是否足够、模型文件是否完整视频导出后模糊分辨率/码率生成时分辨率是否选的 720p 或 1080p导出码率是否过低直播间黑屏推流工具/画面源OBS 预览是否正常推流地址是否正确画面源是否被遮挡直播卡顿网络上行/资源占用本地上行带宽够不够CPU/GPU 占用是否过高数字人出现绿边抠像/合成绿幕光线是否均匀色度键参数是否过强5.1 口型对不上先查输入再查工具口型问题 80% 出在输入不是工具不行。最常见的场景是你复制了一段文案进去但文案里有英文、数字、特殊符号数字人引擎读出来的音和文本不匹配。所以排查顺序是把文案转成纯中文表达例如“2025年”改成“二零二五年”或“两千零二十五年”。检查是否有重复标点、空格、换行。重新生成一条短句如果短句口型正常说明是长文本分段问题。如果短句也异常再怀疑工具参数或音频模型。不要一上来就换模型。换模型会增加变量反而不容易定位问题。5.2 本地部署后生成慢先看显存占用再调参数本地部署的数字人项目最典型的问题是“能跑但很慢”。这时候不要急着换 GPU先打开任务管理器或命令行看显存占用。如果显存已经满了说明参数设置太高需要降低生成分辨率或批处理大小。如果显存占用很低但速度慢可能是 CPU 在跑而不是 GPU 在跑。很多开源项目默认没有启用 CUDA需要手动配置。另外本地部署时版本坑很多。同一个项目不同版本的依赖包可能冲突。安装依赖时不要无脑升级到最新版最好按项目 README 里锁定的版本来安装。如果 README 没有给出明确版本先记录当前安装成功时的环境后面报错时回退。5.3 平台生成慢或失败先检查额度再检查文案格式使用在线数字人平台时生成慢不一定是网络问题。很多平台对免费用户限速或者高峰期排队。先看任务状态是“排队中”还是“生成中”。如果是排队中等 10 分钟再看不需要反复提交。如果任务直接失败重点检查两条文案是否包含平台不支持的表情符号、emoji、特殊字符。文案长度是否超过单次生成限制。通常把文案压缩到 300 字以内去掉特殊符号成功率会明显提高。6. 经验边界和长期使用建议最后写一些我在实际使用中总结的经验不是教程正文但比教程更值得记下来。6.1 新手最容易踩的坑第一个坑是“先买工具后做内容”。很多人兴致勃勃注册了付费工具结果文案没准备好形象也没选好免费额度浪费完了才知道做什么内容。正确顺序是先想清楚做哪个方向写 5 条文案再用免费工具跑通最后再决定要不要付费。第二个坑是“用电脑配置硬扛一切”。在线工具明明能解决非要在低配电脑上跑本地模型结果装环境装了两天视频一条没生成。我建议新手先把在线免费额度用完再考虑本地部署。本地部署是为了长期可控和二次开发不是为了第一天就折腾。第三个坑是“无视平台规则”。数字人直播、AI 生成内容不同平台有不同的公示和标识要求。不要以为技术上能推流就等于能正常使用。开播前看平台规则该标注“AI 生成”就标注该申请资质就申请。技术合规是长期运营的基础。6.2 免费方案的边界在哪里免费或低成本的数字人方案主要边界有三个时长限制免费额度通常只支持生成短视频不是无限时长。分辨率限制部分免费导出只支持 720p或带水印。实时性限制在线平台的生成速度取决于排队无法用于实时互动直播。如果只是学习或做私域内容免费方案完全够用。如果是长期直播或批量生产建议预留一定预算。没有预算的话就用“本地开源部署 批量脚本”的路线用技术成本替换资金成本。6.3 长期做数字人要持续优化三个方向第一个方向是素材库。把文案、音色、形象、标准片头片尾都整理成模板这样每次生产不是从零开始而是套模板换文案。第二个方向是质量检测。建立简单的 check list每次出片都按口型、音频、字幕、背景四层检查。质量标准化之后批量生产才不会乱。第三个方向是内容合规。数字人不是免死金牌口播内容仍然要有依据涉及产品功效、健康、金融等敏感领域时尤其要谨慎。形象和声音的授权也要保留好记录随时能说明来源。最后留一句我自己的心得数字人工具最大的门槛不是选择哪个平台而是你能不能稳定地产出文案并把生成、检查、发布这条流水线跑熟。先做一条跑通再做五条批量最后再考虑实时直播。按这个顺序来你会少踩很多坑。