
用 SadTalker 快速把一张照片和一段音频变成会说话的视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker照片一动不动配音念得再顺嘴型也跟不上。SadTalker 干的就是这件事一张写实人像照片加一段 wav 音频本地跑出嘴型对拍、带头部动作和眨眼的说话视频。 能力边界能做什么、做不了什么能做单张图片肖像或全身配音频产出说话头视频--still可以冻结头部姿态只动嘴--expression_scale调表情幅度--pose_style在 0 到 46 之间取值控制头部动作夸张程度--ref_pose还能从参考视频借头部动作。做不了动漫角色图官方明确不支持只认真人或写实风格它也不管文字转语音音频得你自己备。最适合手里既有照片又有音频、想要成品说话头视频的人不用碰任何训练代码。 最短跑通路径从零到会说话的 4 步拉代码后面所有命令都在这个目录里执行git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker为什么整个外部依赖就是这份代码加几个模型文件没有别的仓库要装。建独立环境锁 Python 3.8conda create -n sadtalker python3.8 conda activate sadtalker为什么requirements.txt 里 numpy1.21.6、numba0.55.1 这类依赖都锁在老版本3.10 以上环境直接装不上。装依赖CPU 用户把第一行换成 cpu 索引源pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 conda install ffmpeg pip install -r requirements.txt这里有个坑FFmpeg 必须装进同一个 conda 环境否则运行时报ffmpeg is not recognized。torch 版本锁 1.12.1 也是同理代码里用到的 cuDNN API 和 2.x 有出入换版本容易在加载模型那步炸。拉模型首次执行脚本带-nc断点续传已有的文件自动跳过bash scripts/download_models.sh为什么scripts/download_models.sh 会把 4 个渲染模型放进checkpoints/、4 个检测修复权重放进gfpgan/weights/inference 启动时直接读这两个目录不用手动摆放。验证环境python inference.py为什么默认值直接读examples/里的示例图和示例音频几分钟后results/下会冒出以时间戳命名的 mp4冒出来就算通了想看中间产物就加--verbose。⚙️ 参数速查别翻源码看这张表命令行参数都定义在 inference.py平时真正会碰的就这几个参数作用默认值什么时候该改--source_image要驱动的人像或全身图examples/source_image/full_body_1.png换成自己的图--driven_audio驱动音频仅支持 wav/mp3examples/driven_audio/bus_chinese.wav换成自己的音频--size人脸渲染分辨率256 或 512256想出清晰人脸且显存够--batch_size并行渲染帧数2显存爆了就设 1--preprocess输入处理方式裁脸 / 整图缩放 / 全身贴回crop全身图用full--still冻结头部姿态只动嘴关全身图必配full一起用--enhancer人脸修复网络 gfpgan/RestoreFormer无出片面部有瑕疵--expression_scale表情强度倍率1.0表情太夸张或太平--ref_pose/--ref_eyeblink从参考视频借头部动作 / 眨眼无默认动作不自然--cpu强制 CPU 运行关没有 GPU全身图要配合--preprocess full --still否则整张图里的头会动得不自然官方示例用的全身输入长这样全身模式把渲染好的人脸贴回原图衣服和背景原样保留这张就是仓库自带的全身示例输入。 三个真实场景参数组合直接抄 256 快速预览先确认环境没问题先用 256 跑一遍示例几分钟内不出错再谈分辨率输出会落在results/目录python inference.py --source_image examples/source_image/art_0.png \ --driven_audio examples/driven_audio/bus_chinese.wav正面清晰、写实风格的人像是最稳的输入这张就是典型的可用图。 512 出片加人脸修复512 下脸更清楚但显存占用接近翻倍batch 降到 1 再挂上修复网络python inference.py --size 512 --batch_size 1 --enhancer gfpgan \ --source_image examples/source_image/art_2.png --driven_audio examples/driven_audio/chinese_news.wav肖像类照片上 512 更有优势修复网络细节补得更多256 时容易糊的边界基本消失。 纯 CPU 跑通CPU 渲染比 GPU 慢一到两个数量级256 加 batch 1拿十秒音频做冒烟测试就够别拿长音频试python inference.py --cpu --size 256 --batch_size 1 跑不通时查什么排障清单ffmpeg is not recognized→ ffmpeg 没和 python 装进同一环境 → 进 sadtalker 环境执行conda install ffmpegCUDA out of memory→ 512 分辨率配 batch 2 显存不够 →export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用 set 代替 export或降--size 256 --batch_size 1FileNotFoundError: checkpoints/...→ 模型文件没下全或放错位置 → 重跑bash scripts/download_models.sh补齐Error while decoding stream→ 喂了 wav/mp3 之外的音频格式 → 先用 ffmpeg 转成 wav 再跑跑通之后想细调参数照着 docs/best_practice.md 的配置建议来。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考