ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

SadTalker 图片变说话头像完整实操指南

SadTalker 图片变说话头像完整实操指南 SadTalker 图片变说话头像完整实操指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个用一张静态人像加一段音频生成说话人头视频talking head的开源工具。如果你想在自己电脑上跑通它跟着本文一步步做装好环境、下完模型、启动界面生成第一个说话视频。⚙️ 它是怎么工作的原理一句话模型先从静态图里提取一组 3D 人脸参数描述脸型与头姿的数值再用音频驱动网络把音频逐帧转成表情与姿态系数最后由渲染器把这些系数回放到原图上输出视频。你全程只需准备两样输入一张真人正脸照暂不支持动漫图和一段wav 或 mp3音频。头部运动、口型、眨眼全部由模型生成喂一段参考视频还能让动作更自然。下图就是同一张图经 SadTalker 在不同角度下生成的说话效果。原理清楚了先看最快看到结果的路。 最短路径跑通一键脚本启动 WebUI最省事的路是项目自带的一键脚本webui.batWindows或webui.shmacOS、Linux它会自动建 Python 虚拟环境、装全部依赖然后拉起 Gradio一个网页界面库页面你不用手动敲安装命令。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalkerWindows双击webui.batmacOS / Linux终端执行bash webui.sh首次启动完成后浏览器打开http://127.0.0.1:7860上传一张人像和一段音频点 Generate 即可。注意模型文件不随脚本下载Linux/macOS 再执行bash scripts/download_models.shWindows 用户按 README 中 2. Download Models 一节手动补齐到checkpoints/与gfpgan/weights/目录。若你完全不想装环境README 的 Quick Start 一节还列了社区 Docker 镜像和在线演示各一句话就能指过去。想逐步控制每个环节往下看完整搭建。️ 本地完整搭建四步从零到出片1. 环境确认。需要Python 3.8官方推荐版本、git和ffmpeg读写音视频文件的工具。分别执行python -V、git --version、ffmpeg -version三条都能输出版本号才继续。Windows 差异装 Python 时务必勾选 Add Python to PATHffmpeg 和 git 用scoop install ffmpeg、scoop install git各一条命令装好。macOS / Linux 差异建议用 conda 建环境ffmpeg 用conda install ffmpeg安装。2. 安装代码与依赖。仓库已在上节克隆接着建独立环境conda create -n sadtalker python3.8 conda activate sadtalker conda install ffmpeg pip install -r requirements.txtWindows 差异已跑过 webui.bat 的话venv 和依赖都已就绪这步可跳过注意 Windows 一键脚本会校验 Python 版本推荐装 3.10。macOS 差异额外执行pip install dlib人脸关键点库M1 芯片不单独装会报 Illegal Hardware Error。Linux 带 N 卡先装 cu113 版 torch命令在 README 的 Installation 一节纯 CPU 机器可跳过。3. 下载模型文件。全部权重一条脚本搞定bash scripts/download_models.sh脚本会拉取主渲染模型如SadTalker_V0.0.2_256.safetensors和人脸增强权重。网络受限时按 README 2. Download Models 一节手动下载放到checkpoints/和gfpgan/weights/两个目录。验证时可以直接用仓库自带的示例输入4. 启动验证。命令行直接生成第一个视频python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/full_body_1.png \ --still --preprocess full跑完会在results/下生成一个带时间戳的 mp4就是全身说话视频。想用图形界面就bash webui.sh浏览器访问http://127.0.0.1:7860。第一条视频出来了接下来调参数把效果调到你想要的程度。️ 关键参数与效果对比以下参数都是inference.py的命令行参数完整参数表见 docs/best_practice.md最常调的 5 个参数作用推荐值--expression_scale表情强度越大动作越夸张0.5–1.5默认 1.0--still--preprocess full保持原图头姿做全身动画全身图推荐组合--enhancer人脸修复网络救回模糊脸gfpgan--ref_eyeblink/--ref_pose从参考视频借眨眼或头部姿态更自然任意短视频比音频短会自动循环--size人脸渲染分辨率256更快512 更细腻但更吃 VRAM即显卡显存下图是参考视频模式的三段对照左边输入图、中间生成结果、右边提供姿态与眨眼的参考视频一眼能看出--ref_pose的效果来源。️ 高频问题速查细节都在 docs/FAQ.md这里收 6 条最高频的现象原因解决办法ffmpeg不是内部或外部命令ffmpeg 没装或不在 PATHconda install ffmpegmacOS 用brew install ffmpegWindows 用scoop install ffmpegNo module named ai类报错epoch_20.pth下载不完整重新下载并核对模型文件大小Illegal Hardware ErrorM1 Macdlib 编译不兼容单独执行pip install dlibFileNotFoundError: checkpoints\BFM_Fitting\...模型文件位置不对按 README 补齐checkpoints/目录结构CUDA out of memory显存不足设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128并调低--size、关增强音频解码报错mp3float音频格式不支持只支持wav和mp3两种格式遇到报错先别硬重试对照上表定位九成问题是环境或模型文件没下齐。 下一步跑通之后遇到的 bug 和新功能需求都可以提交到仓库的issue入口克隆后的项目页面可找到入口维护者响应较快。进阶方向看 docs/webui_extension.md把 SadTalker 装进 Stable Diffusion WebUI 当扩展用出片流程会融入你现有的工作流。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表