Duix.Avatar 本地部署完整指南:四步克隆数字人,离线生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
想做一条讲课程的口播视频,又不想一整天对着镜头念稿?Duix.Avatar 可以接手这件事:把它部署在自己电脑上,它用一段 10 秒左右的视频克隆你的形象和声音,再把你输入的文案直接变成一条口型对得上的数字人口播视频。
这是一套完全离线的数字人视频生成工具,训练和合成都发生在本地。适合批量制作课程视频的教师、需要固定形象口播的自媒体人,以及想给企业配一位数字代言人的团队。不需要写代码,装好服务、点客户端就能用。
🎯 一句话看懂:全离线数字人克隆工具
Duix.Avatar 是一个开源的数字人本地部署工具:你给文案或音频,它还你一个"数字分身"在说话的视频。
- 全程离线:形象训练与视频合成都不需要联网,素材和成片不离开本机。
- 上手门槛低:10 秒视频完成形象和声音克隆,客户端界面点点就能走完整个流程。
- 用法灵活:文本驱动支持中、英、日、韩、法、德、阿拉伯、西语 8 种语言,也支持直接用音频文件驱动口型,可管理多个模型。
🚀 先跑起来:四步完成本地部署
选一台能跑的配置
| 档位 | CPU | 内存 | 显卡 | 磁盘空间 |
|---|---|---|---|---|
| 最低可用 | 主流 CPU | 32GB(16GB 可能起不来服务) | 英伟达独显且装好驱动 | D 盘空闲 30GB 以上,C 盘 100GB 以上 |
| 官方推荐 | 13 代 i5-13400F | 32GB | RTX 4070 | 同左 |
C 盘空间不足时,装完 Docker 后可以把磁盘镜像位置改到空间更大的盘。
环境检查
系统要求:Windows 10 19042.1526 及以上,或 Ubuntu 22.04 Desktop。用下面的命令确认系统版本:
winver # Windows 用户 lsb_release -a # Ubuntu 用户Windows 用户再确认 WSL 状态并更新:
wsl --list --verbose wsl --update安装必要组件
- 安装最新版英伟达显卡驱动。项目所有算力都在本地,没有显卡或驱动,服务起不来。
- 安装 Windows 版 Docker,首次启动时接受协议、跳过登录。
- 打开 Docker 设置的 Resources 页,把"Disk image location"指到空闲空间大于 100GB 的盘:
图:Docker 资源设置页,红框处选择存放镜像的磁盘位置,避免 C 盘被占满
启动项目
克隆仓库,进入 deploy 目录启动服务:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次拉取镜像约消耗 70GB 流量,需要半小时左右,建议连 Wi-Fi 等。容器拉起后服务完全就绪大约还要 10 分钟。
验证服务
docker ps三个服务都处于 Running 状态即成功:ASR 语音识别(端口 10095)、TTS 语音合成(端口 18180)、视频生成(端口 8383)。之后从项目 Releases 页下载安装 Duix.Avatar 客户端,打开能连上服务,就可以开始用了。
🎬 从文字到成片:训练与合成流程
整条流程是一条线:备素材 → 克隆形象 → 生成视频 → 验收。
第一步,准备素材。拍一段 10 秒左右的正面视频。关键要求:视频里的人必须在说话,这段声音会被用来做声音克隆,哑音视频不行。分辨率建议 720p 以上,光线充足。
第二步,克隆形象。打开客户端,在主界面点"Create Avatar"上传这段视频,系统开始训练。基础配置下大约 30 分钟出一个模型,完成后出现在"My Avatars"列表里,这就是你的数字分身。
图:Duix.Avatar 客户端主界面,上半区是视频生成与形象克隆入口,下半区管理工作与数字人模型
第三步,生成口播视频。点"Create Video",选中刚训练好的模型,输入文案(8 种语言任选),或者直接上传一段音频驱动,提交合成。
第四步,验收成片。合成结果自动存入"My Works"。播放检查口型是否对得上、表情是否自然,不满意就换素材或改文案重做,模型可以反复使用。
💼 跑起来能做什么:三类典型用法
课程口播是最高频的用法。教师录一段 10 秒左右的正面视频建好形象,之后每门新课只改文案就能批量产出风格统一的讲解视频,不用再反复进棚。
企业数字代言人适合需要固定形象对外发声的团队。用代言人的形象和声音建一次模型,产品介绍、品牌宣传的内容都从同一个"人"嘴里说出来,视觉调性天然一致。
自媒体批量生产也顺。虚拟主播形象立住之后,固定形象和声音批量出口播内容,更新频率上去了,观众的记忆点也稳。
🛠️ 踩坑速查:三个高频问题
现象:执行 docker-compose up -d 拉镜像失败,提示连接超时解法:Docker Hub 官方源不稳定,给 Docker 配置国内镜像源,或开启全局代理模式后重试。
现象:新增模特时报错 file does not exist解法:源视频里必须有人在说话,程序要拿这段声音做声音克隆。重新录制一段有声的口播视频再上传。
现象:定制模特时报 Connection refused解法:ASR 服务启动比较慢,服务起来后等几分钟再做克隆操作。另外内存只有 16GB 的机器可能起不了服务,建议 32GB。
图:Docker 容器日志界面,红框标出错误堆栈所在位置,排查问题先看对应服务的日志
📚 延伸阅读
- 主程序源码:src/main/,含服务接口、配置与数据库操作
- 部署配置:deploy/,各档 Docker Compose 文件都在这里
- 常见问题文档:doc/常见问题.md,有自查步骤和报错对照
整套服务在消费级显卡的电脑上就能稳定跑起来,过程中不需要注册任何云端账号。
项目地址:https://gitcode.com/GitHub_Trending/he/Duix-Avatar
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考