Duix.Avatar 快速部署教程:从零做出第一个数字人口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个完全离线运行的开源数字人工具:上传一段 10 秒左右的说话视频,它就能克隆你的形象和声音,再输入文案或上传音频,即可生成口型匹配的播报视频。本文写给没接触过命令行和容器概念的读者,读完后你能把本地三个服务全部跑起来,并用客户端做出第一支数字人口播视频。
部署前自查:硬件与 Docker 先确认
| 项目 | 要求 | 说明 |
|---|---|---|
| 系统 | Windows 10(19042.1526 及以上)或 Ubuntu 22.04 桌面版 | 其他 Linux 版本官方未验证 |
| 显卡 | 英伟达显卡并已装好驱动 | 必需项。命令行执行nvidia-smi,能显示显卡信息即通过 |
| 内存 | 32GB 及以上 | 16G 可能导致语音识别服务起不来 |
| 磁盘 | 空闲空间 100GB 以上 | 存放 Docker 镜像和模型文件 |
| 预装软件 | Docker | Windows 装 Docker Desktop;Ubuntu 装 docker 与 docker-compose。docker --version已有输出即可跳过 |
如果 C 盘空闲不足 100GB,装好 Docker Desktop 后可以改镜像存放位置:Settings → Resources → Disk image location,点 Browse 换到空间充足的盘。
环境确认好了,接下来先解决下载速度。
🐳 配置 Docker 镜像加速
项目要拉 3 个镜像包,合计约 70GB。Docker 默认走国外官方源,国内网络很容易中断。解决办法是配置镜像加速源,也就是让 Docker 改从国内的转发渠道拉取。
点 Docker Desktop 右上角齿轮进设置,找到 Docker Engine,在页面里的 JSON 加上registry-mirrors字段填入加速源地址,然后点 Apply & restart。
怎么算配好了:Docker 重启后,后续拉镜像不再出现 request canceled 这类连接中断报错,就说明这一步到位了。
📦 拉取项目代码
打开命令行(Windows 上是 PowerShell),进入想存放项目的目录,执行:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar命令无报错跑完、当前目录下出现 Duix-Avatar 文件夹,说明拉取成功。
🚀 启动三个后端服务
项目的算力全在三个容器里:asr 做语音识别,tts 做语音合成,gen-video 做视频生成,启动配置都在 deploy 目录。执行:
cd deploy docker-compose up -d首次运行会花半小时左右下载镜像,在 Docker Desktop 里能看到下载进度。成功后容器列表里 Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video 三个服务都是 Running,服务端就算就绪。内存紧张的话,可改用同目录的 docker-compose-lite.yml 启动精简版,只起一个视频生成服务。
💻 安装客户端并确认主页
从项目发布页下载官方构建的安装包(Windows 版为 Duix.Avatar-x.x.x-setup.exe),双击安装即可;如果你已有 Node.js 18,也可以直接用源码打包。装完双击桌面快捷方式进入主页,能看到"创建视频"和"创建数字人"两张卡片,说明环境已全部就绪。
首次上手:克隆数字人并生成第一条口播视频
服务刚起完先等几分钟,asr 服务完全就绪比较慢,马上做形象克隆容易报 Connection refused。
主页上方紫色卡片是 Create Video,用来输入文字或上传音频驱动数字人说话;右侧蓝色卡片是 Create Avatar,用来上传真人视频创建数字人形象。下方"我的作品"和"我的数字人"两个页签,分别存放已生成的视频和克隆好的形象。
先点 Create Avatar:上传一段 10 秒左右、正面说话的清晰视频。注意视频必须带声音轨道且人在说话,因为程序要用这段声音做声音克隆。提交后等克隆完成,"我的数字人"页签会出现新的形象卡片。
再点 Create Video:选中刚建好的数字人,输入口播文案或上传音频文件,提交合成。完成后,口型匹配的口播视频就出现在"我的作品"里,可以直接预览和下载。
故障速查:高频问题对照表
出错先看日志:客户端右上角 Setting → 打开日志,会直接定位到客户端日志文件 main.log;服务端日志则在 Docker Desktop 对应容器的 Logs 页签查看。
| 现象 | 可能原因 | 解决办法 |
|---|---|---|
| docker-compose up -d 报 request canceled | Docker Hub 官方源连接中断 | 配置 registry-mirrors 镜像加速,Apply & restart |
| 服务起不来或反复重启 | 无英伟达显卡或驱动未装好 | nvidia-smi 检查,装好驱动后重启 Docker |
| 新增数字人失败 | 上传视频无声音或没有人说话 | 重录 10 秒清晰说话的视频再传 |
| 克隆形象报 Connection refused | ASR 服务未就绪或内存不足 | 服务启动后等几分钟再操作;内存建议 32G |
更多边缘问题可参考仓库里的常见问题文档。
想再深入的话,服务端的形象训练、音频合成、视频合成接口在核心源码里都有现成的调用示例,对照着看一遍就能理解整个链路。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考