ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

SadTalker上手指南:4条命令从单张图片生成说话人脸视频

SadTalker上手指南:4条命令从单张图片生成说话人脸视频 SadTalker上手指南4条命令从单张图片生成说话人脸视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker是CVPR 2023的音频驱动说话人脸动画项目一张静态图片加一段音频就能渲染出人物开口说话的视频。本文按环境准备 → 模型下载 → 首次推理 → 调优与排错给出最短跑通路径照做即可得到第一个输出视频。 首跑成功区4条命令拿到第一个说话视频第1步获取代码并进入目录。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker预期效果当前目录下出现 SadTalker 文件夹内含examples/示例素材、scripts/下载脚本、src/核心源码三个关键目录。第2步创建 Python 3.8 环境并安装依赖ffmpeg 用于输出视频编码缺它后面会报解码错。conda create -n sadtalker python3.8 -y conda activate sadtalker pip install torch torchvision torchaudio conda install ffmpeg -y pip install -r requirements.txt预期效果5~10分钟后执行python -c import torch能打印版本号且无报错。第3步一键下载全部预训练模型。模型下载是最容易卡住的环节跑完后确认checkpoints/下有 4 个文件2 个 mapping 权重、256 和 512 两个SadTalker_V0.0.2_*.safetensors。bash scripts/download_models.sh预期效果checkpoints/与gfpgan/weights/目录文件齐全全程无 404 报错。第4步执行首次推理命令使用仓库自带的中文新闻音频和全身人像图无需任何自备素材。python inference.py \ --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png \ --result_dir results预期效果GPU 上约 1 分钟后results/下出现一个带时间戳命名的.mp4文件如results/2026_09_11_06.51.12.mp4播放即见人物随音频说话。上面命令默认使用的输入图就是这张全身人像 原理速览刚才那条命令做了两件事音频线chinese_news.wav→ 提取声学特征 → 经 audio2exp 生成每帧表情系数、audio2pose 生成姿态系数代码在 src/audio2exp_models/、src/audio2pose_models/。图像线full_body_1.png→ 检测人脸并裁剪 → 拟合出初始 3D 运动系数 → 渲染器按每帧系数逐帧合成画面最后贴回原图存为 mp4渲染模块在 src/facerender/。两条线在系数上汇合音频决定脸怎么动图片决定脸长什么样。 输入与产出说明运行只需要两个素材素材要求仓库现成示例图片单人、正面、面部清晰真人或接近真人风格examples/source_image/下 31 张音频仅支持wav 或 mp3examples/driven_audio/下 14 段素材风格直接影响效果半身/头像图走默认的裁剪模式全身图建议加--still --preprocess full否则整图缩放会失真。仓库的数字艺术风格图如examples/source_image/art_17.png也能跑但真人肖像口型对齐最稳。模型仅支持真人或接近真人的肖像输入动漫风格图效果不保证详见 docs/best_practice.md。产出位置--result_dir指定的目录默认./results文件名带时间戳加--verbose可保留中间产物目录方便排查。⚠️ 常见报错速查首次运行5个高频问题报错现象原因解决方法ffmpeg is not recognized系统缺少 ffmpegconda install ffmpegmacOS 用brew install ffmpegCUDA out of memory显存不足先设环境变量再跑Linux 执行export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用set PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128FileNotFoundError: checkpoints/...或ModuleNotFoundError模型未下载或下载中断重跑bash scripts/download_models.sh核对checkpoints/下 4 个文件齐全Error while decoding stream ... Invalid data (mp3float)音频格式不受支持把音频转成 wav 或 mp3 再传入Illegal Hardware ErrorMac M1dlib 二进制不兼容单独重装pip install dlib更多问题见 docs/FAQ.md。️ 进阶调优最影响结果的3个开关1. 表情强度--expression_scale效果默认 1.0数值越大表情和嘴部动作越夸张1.5 左右通常更有活人感。python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png \ --expression_scale 1.52. 全身动画--still --preprocess full效果--still锁定原图头部姿态只动嘴部和细微表情full模式动画整张图而非裁剪人脸全身人像必用这一组。python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/full_body_1.png \ --still --preprocess full3. 借参考视频眨眼--ref_eyeblink效果单图默认没有眨眼动作该参数从参考视频借眨眼节奏视频更自然参考视频比音频短时会自动循环。python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/art_0.png \ --ref_eyeblink examples/ref_video/WDA_AlexandriaOcasioCortez_000.mp4另外可加--enhancer gfpgan用人脸修复网络提升成片清晰度需要时再加--background_enhancer realesrgan增强整帧。✅ 收尾清单离开前核对5件事Python 3.8 ffmpeg是最小环境要求导入或编码报错先查这两项。模型文件必须齐全checkpoints/下 4 个 gfpgan/weights/下 4 个缺了就重跑下载脚本。源图选真人风格、正面、面部清晰音频只用 wav/mp3。显存吃紧时先设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128再启动。结果默认落在results/时间戳命名重复运行不会互相覆盖。下一步建议按 docs/best_practice.md 继续试--ref_pose姿态参考和 512 分辨率渲染--size 512再结合 docs/FAQ.md 处理剩余问题。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表