ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Duix.Avatar 免费开源数字人完整教程:10秒视频克隆形象,离线生成口播视频

Duix.Avatar 免费开源数字人完整教程:10秒视频克隆形象,离线生成口播视频 Duix.Avatar 免费开源数字人完整教程10秒视频克隆形象离线生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar做一条数字人口播视频传统方案要么按条收费要么把真人素材上传到云端成本和隐私都让人纠结。Duix.Avatar 是一个完全开源免费的 AI 数字人工具包在本地离线完成形象与声音克隆提交一段约 10 秒的真人视频即可得到数字分身再输入文案或上传音频就能自动生成口型同步的播报视频。它适合谁能替你做什么内容创作者一个人、一台电脑就能产出数字人口播内容不用再出镜、补拍和剪后期。企业用户素材和成片都在内网机器上生成全程不联网降低数据外泄风险。开发者项目开放了模特训练与视频合成的本地接口可以把数字人能力直接嵌进自己的业务系统。部署实操把三个服务跑起来Windows 一键部署步骤先确认硬件满足条件再动手装环境。系统要求Windows 10 19042.1526 或更高版本必须有 D 盘存放数字人、作品等数据空闲空间大于 30GC 盘存放 Docker 镜像空闲大于 100G空间不够时装好 Docker 后在设置里把磁盘位置改到别的分区推荐配置i5-13400F、32G 内存、RTX 4070。必须有 NVIDIA 显卡且驱动安装正常这是硬性条件。安装步骤拉取项目代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar检查并更新 WSL未安装过就先用wsl --install装一下wsl --list --verbose wsl --update安装 Docker for Windows按 CPU 架构选择对应安装包。在仓库的deploy目录启动服务端首次拉取约 70G 流量建议连 WiFi 耐心等待cd deploy docker-compose up -d看到 Docker 中出现 3 个服务且全部 Running 即部署成功。磁盘紧张可改用精简版只启动一个Duix.Avatar-gen-video服务docker-compose -f docker-compose-lite.yml up -d50 系显卡5090 已测试通过30/40 系 CUDA 12.8 用户也可用换用专用编排文件docker-compose -f docker-compose-5090.yml up -d客户端从官方构建的发布页下载安装包双击Duix.Avatar-x.x.x-setup.exe完成安装。Ubuntu 22.04 部署步骤Ubuntu 版本已完成 22.04 Desktop内核 6.8.0-52-generic适配验证客户端界面支持英文。推荐配置同 Windowsi5-13400F / 32G 内存 / RTX 4070 / NVIDIA 驱动另需硬盘空闲大于 100G。检查 Docker没装过就补装docker --version sudo apt update sudo apt install docker.io docker-compose按 NVIDIA 官方文档安装显卡驱动执行nvidia-smi能显示显卡信息即成功再安装让 Docker 调用 GPU 的 NVIDIA Container Toolkitsudo apt-get install -y nvidia-container-toolkit sudo nvidia-ctk runtime configure --runtimedocker sudo systemctl restart docker启动 Linux 版服务端cd deploy docker-compose -f docker-compose-linux.yml up -d客户端下载 Linux 版 AppImage双击即可运行root 用户需加参数./Duix.Avatar-x.x.x.AppImage --no-sandbox核心流程上手 从克隆形象到导出成片整条链路分三步训练模特 → 驱动形象 → 导出成片。数字人模特训练入口在哪入口在客户端首页的快速定制Create Avatar卡片。输入一段约 10 秒的真人说话视频程序会自动分离出静音视频与音频分别用于形象克隆和声音克隆。提交后得到一个可反复使用的数字模特脚本支持中、英、日、韩、法、德、阿拉伯、西班牙语八种语言。怎么驱动数字人开口说话入口是首页的短视频制作Create Video卡片。左侧选择已训练好的模特中间实时预览右侧填写内容可以直接输入文案由系统转成语音驱动口型也可以直接上传音频文件数字人会按语音的节奏和语调做动作与表情变化。成片在哪导出合成完成后视频自动进入我的作品列表支持查看、保存和删除多个模特可在客户端内统一管理按场景随时切换。接入与扩展 ⚡开放 API 与选型建议服务端启动后接口通过http://127.0.0.1在本地暴露。完整调用逻辑可参考src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js三个文件。模型训练接口先把视频分离为静音视频 音频音频放入约定目录与语音合成服务约定可在 docker-compose 中修改D:\duix_avatar_data\voice\data再调用预处理接口把音频转成克隆所需的参考信息http://127.0.0.1:18180/v1/preprocess_and_tran返回中的asr_format_audio_url和reference_audio_text要保存下来后续合成要用。音频合成接口http://127.0.0.1:18180/v1/invoke传入上一步的参考音频、参考文本和要合成的文案即可输出克隆音色的语音文件。视频合成接口提交合成任务http://127.0.0.1:8383/easy/submit用任务 code 轮询进度GET 请求taskCode即提交时的code值http://127.0.0.1:8383/easy/query?code${taskCode}本地部署还是 API 服务怎么选对比维度自建本地部署数字人 API 服务更推荐人群有深度学习经验、想深度定制的技术用户追求快速集成、需企业级保障的商业团队硬件投入需自备 GPU 服务器无需采购 GPU二次开发源码可自由修改扩展只能在 API 层面扩展运维迭代维护成本较高问题修复依赖社区维护简单新模型算法优先可用生成效果口型效果可用口型更自然、画质更高商用授权全球免费商用超大企业需签商业许可协议可商用判断标准很简单自己玩、想改代码选本地部署要上线、要省心选 API 服务。遇到问题先按这份清单自查 服务是否全部 Running在 Docker 里确认 3 个服务的状态精简版只需 1 个任何一处在重启后面都会卡住。显卡与驱动是否就位执行nvidia-smi看能否输出显卡信息。本项目算力全部在本地没有 NVIDIA 显卡或驱动服务根本起不来。镜像拉取超时、连接失败Docker Hub 官方源不稳定在 Docker Engine 配置中加入国内镜像源registry-mirrors后重试。克隆形象报错素材视频必须有人在说话否则声音克隆无从下手若报Connection refused多为语音识别服务启动慢等服务几分钟再试内存只有 16G 的机器可能直接起不来。先更新、留好日志再提问项目更新频繁先确认服务端重新docker-compose up -d和客户端都是最新版。排查时保留两份日志客户端在右上角设置菜单点打开日志定位到main.log服务端在对应容器日志页点击复制。写在最后Duix.Avatar 把原本昂贵的数字人生产线搬进了本地机器开源社区的持续迭代还会不断降低它的门槛。建议先按本文完成一次完整部署遇到问题查阅 常见问题并阅读 LICENSE 了解商用授权边界。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表