ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

HeyGem.ai 数字人本地部署完整指南:3 步生成你的第一条 AI 口播视频

HeyGem.ai 数字人本地部署完整指南:3 步生成你的第一条 AI 口播视频 HeyGem.ai 数字人本地部署完整指南3 步生成你的第一条 AI 口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarHeyGem.ai开源项目 Duix.Avatar是一个能在你自己电脑上跑的数字人视频生成工具上传一段 10 秒左右的视频它会学会你的长相和声音做出属于你的数字分身。之后你只需要输入一句话或上传一段录音它就能自动生成口型对得上的口播视频全程离线视频和声音都不用出你的机器。这篇文章带你走通 HeyGem.ai 本地部署的完整流程从确认配置到排出最常见的坑。开始本地数字人部署前先对照硬件和磁盘空间这个项目所有计算都在本地完成所以硬件是硬门槛装之前先对一遍显卡必须是 NVIDIA 显卡并且装好了最新的显卡驱动。没有独显的话服务起不来这是最常见的白忙活。内存32G 起步低于这个数容易在生成视频时卡死。磁盘Windows 上需要 D 盘空余 30G 以上存数字人和作品C 盘空余 100G 以上存 Docker 镜像。C 盘不够也没关系装完 Docker 后可以在设置里把镜像目录改到别的盘如下图位置Ubuntu 22.04 用户同样需要 32G 内存、NVIDIA 显卡加驱动、100G 以上硬盘。配置不够也没关系下文会讲一个更轻量的 lite 版本。HeyGem.ai 三步快速启动部署服务端、拉起客户端整个部署就三个动作把代码拿到手、把服务端容器跑起来、把客户端打开。第 1 步获取项目代码git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai第一条命令把项目克隆到本地第二条进入项目目录。这个项目本身就是客户端源码服务端由 Docker 提供。第 2 步启动服务端进入项目里的deploy/目录执行docker-compose up -d这一条命令会拉取并启动三个服务语音识别ASR、语音合成TTS、视频生成。首次运行要下载约 70G 的镜像官方建议预留半小时以上建议连 WiFi。Docker Desktop 里看到三个服务都变成 Running就说明服务端就绪了。第 3 步启动客户端回到项目根目录先装依赖再启动npm install安装客户端运行所需的全部依赖包。装完执行npm run dev启动开发模式的客户端窗口。如果你不想自己跑源码也可以直接去项目发布页下载打包好的安装程序Windows 是 exeUbuntu 是 AppImage双击就能用效果一样。先创建数字人再产出口播视频客户端完整用法客户端首页就两个入口Create Avatar创建数字人和 Create Video生成视频使用顺序固定——先有人再有片。创建数字人约 1 分钟上传稍等训练点右侧蓝色区域的 Create Avatar上传一段你出镜说话的视频10 秒左右即可。注意两点画面里的人必须在说话声音要清晰——程序要从这段声音里克隆你的音色无声视频会直接报错。给数字人起个名字提交后等待训练完成。成功后它出现在 My Avatars 标签页里以后随时可以复用。生成口播视频输入一句话就能出片点紫色区域的 Create Video选择刚创建好的数字人。输入方式两种任选直接打字或上传一段现成音频。提交后系统自动合成语音打字模式并驱动数字人口型完成后视频进入 My Works 列表点开即可播放、下载。脚本支持 8 种语言中、英、日、韩、法、德、阿拉伯、西班牙语。客户端界面本身也支持中英文切换在右上角设置里点 Language switch 即可进阶调优更省的部署、新显卡适配和 API 批量调用跑通之后有三种方式可以让 HeyGem.ai 部署更贴你的场景。配置不够用 lite 版本lite 版只跑一个视频生成容器资源占用小很多8G 显存也能用。在deploy/目录执行docker-compose -f docker-compose-lite.yml up -d功能相同适合显存和内存吃紧的机器。用 50 系显卡换专用配置RTX 50 系官方按 5090 测试通过需要新版 CUDA 环境deploy/目录里专门放了一份配置文件docker-compose -f docker-compose-5090.yml up -d30、40 系显卡如果也升级到了 CUDA 12.8同样可以用这份配置。所有配置文件都在 deploy 目录 下打开就是能看懂的 YAML。想做批量或集成直接调开放 API服务端启动后会在本机开放几个端口你不需要经过界面就能调用适合做批量生成或嵌进自己的系统视频合成向http://127.0.0.1:8383/easy/submit提交音频加视频路径拿回一个任务码再用http://127.0.0.1:8383/easy/query?code任务码轮询进度。声音克隆与合成http://127.0.0.1:18180上的接口先对参考音频做预处理再把文本合成成指定音色的语音。请求参数和返回格式不用猜客户端调用这些接口的代码就是现成示例在 src/main/service/ 目录下按 model.js、video.js、voice.js 三个文件对着看即可。本地部署最常见的 3 个坑以及自诊办法坑一docker-compose 拉镜像失败报 request canceled / connection refused这是新手遇到最多的问题根因是 Docker Hub 官方源连不上。解决办法是给 Docker 配国内镜像加速。Linux 用户在/etc/docker/daemon.json里加一段registry-mirrors配置即可Windows 用户同样在 Docker Desktop 的设置面板里编辑对应的 JSON 配置文件改完重启 Docker 再重新执行docker-compose up -d。镜像源会随时间失效配之前搜一下当前可用的地址。坑二创建数字人报错其实是上传的视频不对如果提交模特视频后失败先检查素材视频必须带声音、且画面里的人在说话。声音是克隆音色的原料视频无声或只有背景音乐训练必然失败。重录一段口播视频再传即可。坑三训练时报 Connection refused连接被拒绝这个错的意思是某个后端服务没跑起来去 Docker 里确认三个服务的状态把挂掉的那个重启。如果反复重启仍失败多半是显卡驱动问题——用nvidia-smi验证驱动是否正常输出显卡信息。真实的服务日志长这样看到红色报错行基本就能定位到是哪个环节问题查不出来的自诊顺序看三个服务是否全部 Running任何一个异常先修它。确认有 NVIDIA 显卡且nvidia-smi能正常显示驱动不是一切的前提。把服务端和客户端都更新到最新版本社区更新频繁你的问题可能已经修了。翻一遍 常见问题文档里面按现象整理了报错和对应解法。提问前顺手把两边的日志各留一份客户端在右上角设置点 Open Log日志文件在用户目录的 heygem.ai/logs 里服务端日志直接在 Docker Desktop 里点开对应容器右侧复制按钮一键导出收尾部署完成下一步做什么到这里你已经有了一个完全离线、可反复使用的数字人产线一段 10 秒视频换一个人一句话换一条口播视频。建议下一步这样做——先用 lite 配置验证全流程再录一段 30 秒、语速平稳、光线均匀的素材练手最后按需接入 API 做批量生成。硬件、配置、API 与排错的细节随时回看 deploy 目录 和 常见问题文档。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表