Duix.Avatar 开源数字人克隆工具:10秒视频离线生成口播视频的完整方案
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款完全开源的数字人克隆工具:提交一段 10 秒左右的真人视频,即可离线克隆你的形象和声音,再用文字或语音驱动,自动合成口型对齐的口播视频。它专为 Windows 设计,也支持 Ubuntu 22.04 桌面版,全程无需联网,素材和成片都不出本机。
先看一个真实问题
我刚跑完
docker-compose up -d,三个服务都显示 Running,新增模特训练却报 Connection refused,是网络不通吗?
大概率不是网络问题。原因有两个:一是Duix.Avatar-asr服务启动比较慢,服务端刚起来时 ASR 还没就绪,标准做法是等几分钟再执行克隆形象;二是机器内存太小(比如 16G)时服务可能根本拉不起来。另外还有一个容易忽略的前置条件:用来创建模特的视频必须有声音,且是人在说话,因为程序要拿这段声音做声音克隆。遇到报错时,客户端日志和服务端 Docker 日志都要看,常见问题文档里给出了两者的获取方式。
📌 服务 Running 不等于立即可用:克隆前先确认三个服务都启动完成,再检查源视频"有人声、在说话"这两个硬条件。
它到底是什么
Duix.Avatar 是一个数字人克隆加离线视频合成的桌面工具:客户端是 Electron + Vue 3 应用,后端是 3 个 Docker 服务(语音合成、语音识别、视频生成)组成的本地推理栈,当前客户端版本为 1.0.6。
- 全离线运行:所有算力都在本地,无需联网,素材隐私不出机器
- 形象声音双克隆:高精度捕捉五官轮廓,同时还原人声的语调与节奏特征
- 文字/语音双驱动:输入文案直接合成语音,或直接上传音频驱动数字人
- 多语言脚本:文案支持英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语 8 种语言
能力清单:从克隆到合成的 5 项能力
| 能力 | 说明 |
|---|---|
| 形象克隆 | 基于真人视频训练专属数字人模型,支持导入多个模型管理 |
| 声音克隆 | 由 fish-speech 引擎克隆音色,本地服务端口 18180 |
| 语音识别 | 由 fun-asr 引擎将人声转成文本,用于声音克隆的文本对齐 |
| 口播视频合成 | 文字或音频驱动数字人,自动完成口型同步与音视频对齐,端口 8383 |
| 开放 API | 模型训练、语音合成、视频合成三步均提供本地 HTTP 接口,可嵌入自有业务 |
你还可以直接丢给它的问题
镜像拉取超时,卡在部署第一步
docker-compose up -d一直报 request canceled / context canceled,怎么解决?
这是 Docker Hub 官方源连接不稳定的典型表现。两条路:开启全局代理直连,或者给 Docker 配置镜像加速源(改daemon.json里的 registry-mirrors)。另外首次部署会下载约 70GB 镜像,官方建议挂 WiFi 并预留大约半小时。
📌 拉镜像阶段耗时长是正常现象,三个服务(精简版只有 1 个)全部 Running 才算部署完成。
把合成功能接进自己的业务系统
我不想只用桌面客户端,想把数字人视频合成嵌进自己的 App,有接口吗?
有。Docker 启动后三个服务都在http://127.0.0.1上暴露端口:语音合成走18180/v1/invoke,视频合成提交走8383/easy/submit,再配8383/easy/query轮询任务进度。客户端源码里src/main/service/下的 model.js、video.js、voice.js 就是完整的调用示范,照着抄即可。
⚠️ 本地部署要求你自备 NVIDIA 显卡服务器并承担维护成本;如果追求更高清的口型效果和 SLA 保障,官方另有商业 API 服务方案,README 里有两种路线的逐项对比表。
RTX 50 系列新显卡能不能跑
我新机器是 RTX 5090,官方镜像能直接用吗?
可以,但不要用默认的 compose 文件。50 系列走deploy/docker-compose-5090.yml,对应镜像换成guiji2025/fish-speech-5090和guiji2025/duix.avatar-5090,官方已基于 5090 实测通过;30/40 系列配合 CUDA 12.8 也验证可行。
它明确不做什么
- 实时交互数字人:本项目只做数字人克隆和非实时视频合成。想要实时对话式的数字人,官方指向 duix.com 官网的在线体验/商业方案,不在开源范围内。
- 无 GPU 环境运行:三个服务全部依赖 NVIDIA 显卡,没有 N 卡或驱动没装好,服务直接起不来,官方也不提供纯 CPU 部署路径。
- 商业级口型效果与 SLA:开源本地版的口型效果官方定性为"可用",惊艳级高清效果和专业技术响应团队归属于商业 API 服务,不在开源仓库的责任边界内。
找资料:文档与源码
- 中文总览与部署说明:README_zh.md,英文版见 README.md
- 常见部署问题与排查步骤(镜像超时、新增模特报错、服务连接拒绝等):doc/常见问题.md
- Docker 编排文件,含标准版、Ubuntu 版、精简版和 5090 版共 4 套:deploy/
- 客户端开放 API 的调用实现:src/main/service/
- 商用授权条款:LICENSE 及仓库根目录的中英文模型社区许可协议 PDF
三步开始上手
- 准备一台 Windows 10 19042.1526+ 或 Ubuntu 22.04 机器,确认 NVIDIA 显卡驱动可用(
nvidia-smi能输出显卡信息),D 盘留 30GB、C 盘留 100GB 以上;然后克隆仓库:git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar - 进入
/deploy目录执行docker-compose up -d(磁盘紧张或只需合成功能时用docker-compose -f docker-compose-lite.yml up -d只起 1 个服务),等待约 70GB 镜像下载完成、服务全部 Running - 安装官方客户端,上传一段 10 秒左右、有清晰人声的真人视频完成形象和声音克隆,再输入文案或上传音频,即可生成第一条口播视频
收尾
Duix.Avatar 把"形象克隆、声音克隆、口型合成"这条完整链路做成了可以离线跑通的开源工具,一条 compose 命令就能搭起本地数字人生产线。对内容创作者和企业来说,它意味着素材隐私不出本机、视频量产不再按次付费。从第一条口播视频开始,这套本地栈可以长期成为你的数字人基础设施。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考