ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

SadTalker 数字人制作教程:一张照片加一段音频,生成会说话的头像视频

SadTalker 数字人制作教程:一张照片加一段音频,生成会说话的头像视频 SadTalker 数字人制作教程一张照片加一段音频生成会说话的头像视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个基于 CVPR 2023 论文的开源项目做法很直接给它一张肖像图或半身照和一段音频它就输出一段这张脸在说话的视频。对内容创作者、做课件的老师、想给静态头像加上口型的个人来说它把原本需要建模、绑定的活变成了三条命令而且支持本地离线跑不上传任何素材。部署前先看这 3 件事 装之前花 1 分钟确认环境能避开后面一大半报错Python 版本推荐用 Anaconda 建一个 Python 3.8 的独立环境避免和系统里其他包的依赖打架。ffmpeg 是否可用项目用 ffmpeg 来读音频、拼帧。终端里敲ffmpeg -version没有就先装上Linux 可conda install ffmpeg。GPU 可选但有用有 CUDA 显卡时生成明显更快纯 CPU 也能跑只是慢。显存不够时可以把--size调小或关掉增强。确认这三点后再动手比装到一半报错再回查要省事。从零开始安装、拉模型、第一次出片整个上手分三步全部在本地完成。1. 克隆仓库并装依赖git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 -y conda activate sadtalker pip install -r requirements.txt2. 下载模型权重模型分两部分渲染用的权重进checkpoints/人脸增强用的进gfpgan/weights/。一条脚本全下完bash scripts/download_models.sh网络不顺利时脚本里的每个wget地址都可以单独重跑wget -nc支持断点续传下完解压到对应目录即可。3. 跑第一张图不用打开界面命令行直接出片python inference.py \ --source_image examples/source_image/full_body_1.png \ --driven_audio examples/driven_audio/chinese_news.wav \ --enhancer gfpgan生成结果会按时间戳存到results/下找到最新的文件夹里的.mp4就是成片。想边调边看的话也可以起 Web 界面python app_sadtalker.pyWindows 下直接双击webui.batLinux/macOS 用bash webui.sh依赖会自动装好。预处理模式没选对效果差一半 ⚙️--preprocess决定图片在动画前怎么处理是新手最该先定的参数。按场景 → 怎么选 → 为什么来看只露脸、背景不重要 →crop默认自动裁出人脸区域再动画嘴部对齐最稳绝大多数头像照选它没错。证件照、大头照、想要一张会说话的证件照 →resize整图等比缩放到目标分辨率人脸位置基本不动。注意它对全身照效果差别用在长图里。半身、全身照想保留衣服和构图 →full搭配--still只动画脸部区域再贴回原图配合--still固定头部姿态身体不会乱晃。还想要更紧或更松的裁切可试extcrop/extfull。一句话先按图的构图类型定模式再去调别的参数。口型或表情不自然时优先调这几个参数模式选对了之后效果微调主要就这几个旋钮改动成本都很小--expression_scale默认 1.0控制表情幅度。偏木讷就加到 1.2~1.5动作过头就压到 0.5 左右。--still锁住头部朝向。全身/半身动画时加上它头不会乱转。--ref_eyeblink给一段带自然眨眼的参考视频借它的眨眼动作能明显减少假人感。仓库里examples/ref_video/就备了现成的参考片。--ref_pose同理借参考视频的头部动作让姿态更生动。--enhancer gfpgan生成后对脸部做一次增强清晰度更高显存紧张时可以先关掉出预览满意了再开。建议一次只动一个参数、对比一次成片否则分不清是哪一项起了作用。不同素材对应不同玩法 同样是照片 音频输入图类型不同出片策略就不一样写实人像cropgfpgan走默认路线最稳。油画、插画等艺术风格用full--still保构图动画时风格特征笔触、色调会被保留嘴部照样能跟上节奏。全身或半身照full--still重点看衣服和姿势是否被完整保留。证件照resize适合做会说话的证件照这类固定角度内容。新手最容易卡住的几个报错提示 ffmpeg 找不到环境里缺 ffmpeg。Linux/macOS 用conda install ffmpeg或系统包管理器装Windows 手动装好后重开终端。报错说模型/权重不存在多半是scripts/download_models.sh没跑完检查checkpoints/和gfpgan/weights/两个目录是否齐了。生成很慢或显存不足先不加--enhancer、把--size从 512 降到 256或调小--batch_size预览通过后再上高质量参数。口型和音频对不上先确认音频清晰清晰的 WAV 比嘈杂录音好很多再试着调--expression_scale别急着怀疑模型本身。更完整的排查清单在 docs/FAQ.md。按阶段查这些资料就够用了装环境、下模型遇到问题安装文档、模型下载脚本调参、看推荐组合最佳实践与配置说明出片前值得先读一遍3D 人脸重建相关face3d 文档想接进 Stable Diffusion WebUIWebUI 扩展说明想自己翻代码音频→表情模块在 src/audio2exp_models/面部渲染在 src/facerender/3D 人脸在 src/face3d/想换素材试效果现成音频在 examples/driven_audio/示例图和参考视频在 examples/source_image/、examples/ref_video/给你的起步清单先用一张清晰的正脸照 一段干净的 WAV走crop默认配置出第一片确认链路通了。每改一个参数就记一笔改了哪个、效果变好还是变差攒成自己的对照表比反复盲调快。出片不满意时按顺序排查预处理模式 →--expression_scale→--ref_eyeblink→--enhancer。想深入再看 最佳实践文档 和对应源码模块别一上来就啃全部代码。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表