ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Duix.Avatar本地部署教程:用10秒视频完整做出AI数字人口播视频

Duix.Avatar本地部署教程:用10秒视频完整做出AI数字人口播视频 Duix.Avatar本地部署教程用10秒视频完整做出AI数字人口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar在一台配备NVIDIA显卡的Windows 10或Ubuntu 22.04机器上完成一次约30分钟的本地部署后你可以用Duix.Avatar离线生成AI数字人口播视频。本文按先结果、后搭建的顺序讲清从克隆源码、启动容器到安装客户端的完整AI数字人本地部署流程覆盖数字人克隆、声音克隆与文本、语音两种驱动方式部署完成后全程无需联网。Duix.Avatar功能速览声音克隆到数字人视频生成功能输入输出限制数字人克隆一段10秒左右、带清晰语音的视频数字分身模型可在My Avatars列表查看视频必须有声音且是人在说话声音克隆与合成语音样本存放于D:\duix_avatar_data\voice\data用克隆音色朗读文本的音频通过本地API18180端口调用文本驱动视频数字人模型 文本内容口播视频支持8种语言中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语语音驱动视频数字人模型 音频文件口型同步的口播视频表现取决于音频的节奏与语调全离线运行本地NVIDIA显卡语音合成TTS文本转语音、语音识别ASR语音转文本、视频生成三个服务无英伟达显卡或驱动未装好时三个服务均无法启动项目支持全球免费商用所有算力都在本地完成离线数字人视频从生成到存储不经过任何网络传输。部署前检查清单显卡、系统与磁盘要求检查项要求显卡英伟达显卡并正确安装驱动用nvidia-smi可验证视频生成服务至少8GB显存CPU / 内存推荐第13代英特尔 i5-13400F 或更高内存32GB及以上系统Windows 10 19042.1526 或更高版本或 Ubuntu 22.04 桌面版磁盘WindowsC盘100GB以上存镜像D盘30GB以上存数据Linux可用空间100GB以上工具Docker DesktopWindows或 Docker EngineLinux客户端开发需要 Node.js 18Docker 是把服务打包进容器运行的环境可保证服务端环境一致。Linux 下还需安装 NVIDIA Container ToolkitDocker 才能调用显卡。三步完成本地部署源码、容器与客户端1. 克隆源码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar2. 启动容器服务cd deploy docker-compose up -d首次启动约需30分钟下载70GB左右的镜像建议连接WIFI。完成后完整版会运行三个服务duix-avatar-tts语音合成端口18180、duix-avatar-asr语音识别端口10095、duix-avatar-gen-video视频生成端口8383。如果只需要视频生成服务改用轻量版docker-compose -f docker-compose-lite.yml up -d。若C盘剩余空间不足100GB可在Docker Desktop的 Settings → Resources → Advanced 中通过 Browse 把 Disk image location 迁移到空间充足的磁盘。3. 安装客户端Windows从项目发布页下载Duix.Avatar-x.x.x-setup.exe双击安装。Ubuntu下载Duix.Avatar-x.x.x.AppImage执行chmod x后用./Duix.Avatar-x.x.x.AppImage --no-sandbox运行无需安装。端到端演示从建分身到数字人视频出片完整动线为三步建分身 → 克隆声音 → 出片。第一步建分身数字人克隆。在客户端点击Create Avatar上传一段10秒左右、面部清晰、自然说话的视频。系统自动完成面部特征提取与模型训练生成的模型出现在My Avatars列表中。视频必须包含人声声音克隆会直接使用这段音频。第二步克隆声音。将语音样本音频放入D:\duix_avatar_data\voice\data该目录与语音合成服务约定可在docker-compose中修改调用http://127.0.0.1:18180/v1/invoke合成接口调整音调、语速等参数即可得到接近原声的克隆音色。第三步出片。在Create Video中选择已创建的数字人。文本驱动模式下输入文案后系统先用克隆音色合成语音再驱动数字人口型语音驱动模式下直接上传音频系统分析其节奏与语调自动生成对应的嘴部动作两种方式最终都输出口型同步的口播视频。避坑与解决本地部署最高频的4个问题1.docker-compose up -d连接失败。多数是Docker Hub官方源连接不稳定导致的超时报错。在Docker Desktop → Docker Engine中配置registry-mirrors国内镜像源或开启全局代理后重试并确认磁盘空间充足。2. 容器起不来或无法使用GPU。项目全部算力依赖本地英伟达显卡没有显卡或驱动没装好时三个服务都启动不了。先用nvidia-smi确认显卡信息Linux 还需安装NVIDIA Container Toolkit执行nvidia-ctk runtime configure --runtimedocker后重启Docker服务。3. 客户端连不上本地服务。先确认三个服务都是Running状态、端口18180、10095、8383未被占用再查看服务日志定位问题也可在Docker Desktop的日志面板中复制输出docker logs duix-avatar-gen-video4. 创建模特或训练失败。确认输入视频有声音且是人在说话格式推荐MP4、光线充足显存至少8GB。仍有报错时查看客户端日志AppData\Roaming下 logs 目录中的main.log与服务端日志更多问题可对照 doc/常见问题.md。进阶与效果调优API集成与参数调整API集成。容器启动后会在本地127.0.0.1暴露一组接口可直接用于二次开发模特训练18180/v1/preprocess_and_tran、音频合成18180/v1/invoke、视频合成提交8383/easy/submit、进度查询8383/easy/query。具体参数写法见 src/main/service/ 中的 model.js、video.js、voice.js。GPU适配。使用50系列显卡5090已测试通过时改用docker-compose -f docker-compose-5090.yml up -d启动30、40系列且为CUDA 12.8的用户也可采用该方案。合成参数调优。音频合成时可调整 topP多样性、temperature情感表现、repetition_penalty抑制重复、chunk_length分块长度等参数来改变音色表现无需改动代码。适用场景与参考路径企业产品演示介绍员、标准化培训视频、客服口播代表教育在线课程、多语言发音示范个人短视频内容创作、虚拟形象代言部署配置见 deploy/服务端API实现见 src/main/service/常见问题见 doc/常见问题.md。建议先运行nvidia-smi并核对磁盘空间再按上文三步完成部署等三个服务全部Running后用一段10秒视频就能做出第一条数字人口播视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表