本地数字人怎么跑起来:用10秒视频克隆形象,全程离线生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
把一段10秒左右的手机自拍视频交给 Duix.Avatar,它能克隆出你的形象和声音;之后输入一段文案,或直接上传自己的录音,就能得到一个口型同步的说话视频。整个过程在本机完成,不用把素材上传到云端——这是这个开源项目最值得先知道的一点。
它是什么,适合谁
Duix.Avatar 是一个全离线的数字人视频工具:服务端跑在 Docker 里(基于本地 NVIDIA 显卡),客户端是一个桌面程序,负责上传素材、录入文案、预览和导出。官方推荐配置是 i5-13400F、32G 内存、RTX 4070 级别显卡,磁盘预留 100G 以上;社区里有不少 8G 显存显卡跑通的反馈,显存需求在同类方案里算比较省。
它适合三类人:
- 做课程、口播、产品演示,需要频繁更换文案但不想反复出镜录制的创作者;
- 在意素材隐私、不想让视频和声音离开自己机器的用户;
- 想基于开放 API 做二次开发、把数字人能力嵌进自己产品的开发者。
最低配置要求与最短启动路径
先说硬件底线,三条都是硬要求:
- 有 NVIDIA 显卡并装好驱动(所有算力都在本地,没有 N 卡三个服务都起不来);
- 内存 32G 及以上(16G 内存的机器 ASR 服务可能直接启动失败);
- Windows 需要 D 盘空闲大于 30G、C 盘大于 100G(存镜像);Ubuntu 需要 100G 空闲磁盘。
服务端就是几条命令的事。以 Ubuntu 22.04 为例,装好 Docker 和 NVIDIA Container Toolkit 后:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose -f docker-compose-linux.yml up -dWindows 用户在仓库的deploy目录直接执行docker-compose up -d即可。首次拉取镜像会消耗约 70G 流量,官方给出的等待时间是半小时左右,速度取决于你的网速,建议连 WiFi 耐心等。启动成功后 Docker 里会看到duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务处于 Running 状态。
客户端不需要自己编译,从项目 Releases 页面下载官方构建的安装包:Windows 是 exe 安装程序,Linux 是 AppImage,双击即可。
核心能力拆解
形象 + 声音一次克隆。上传一段约10秒、有清晰人声的视频,程序会同时完成外貌建模和声纹克隆,之后这个人"开口"用的就是你的声音。适合需要统一出镜形象的团队。
文本、录音双驱动。生成视频时可以输入文案由 TTS 合成本人音色朗读,也可以直接上传一段录音(支持 mp3、wav 等,单条小于 30 分钟,官方提示用干声、避开背景音效果更好)。适合有现成脚本或已录好旁白的场景。
全离线,数据不出机器。从视频采集、预处理、克隆到合成导出,全程无网络交互,素材只存在本地磁盘。适合对隐私敏感的内容生产。
开放本地 API。Docker 启动后在 127.0.0.1 上暴露模特训练、音频合成、视频合成三类接口(端口 10095 / 18180 / 8383),源码在src/main/service/下有完整调用示例。适合想把数字人能力接进自有系统的开发者。
两个真实使用场景的复盘
第一次部署,卡在拉镜像。我在 Windows 上跟着文档走,docker-compose up -d执行后三个容器反复报错,日志里全是registry-1.docker.io连接超时——就是 Docker Hub 官方源在国内访问不稳定的老问题。处理办法是在 Docker Desktop 的 Docker Engine 设置里加上国内 registry 镜像源(官方常见问题里给了一份现成配置),改完 Apply and restart,重新拉取就顺了。
克隆第一步报 Connection refused。服务端刚拉起来我马上就上传视频做模特克隆,结果客户端直接报Connection refused,日志里能看到 ASR 服务还没建立连接。后来才明白 ASR 服务启动比较慢,官方建议服务端启动后等几分钟再做克隆操作。等了几分钟重试,克隆顺利通过,客户端首页就多了这个"数字分身"。
把课程口播搬回家。第二个场景是我录了一段 10 秒的正面说话视频(文档要求至少 8 秒、吐字清晰、必须带人声),克隆成功后,写一段讲稿贴进文案输入框,生成的视频里"我"的口型和讲稿逐句对应;换文案重新生成不需要再录任何东西。客户端首页的 My Avatars 和 My Works 分别管理克隆的形象和生成的作品,支持建多个形象切换,做系列内容时很方便。
硬件门槛与可选部署方案
服务端提供三份 compose 文件,按需选一个,不要混用:
| 方案 | 启动命令(deploy 目录下) | 容器 | 适用场景 |
|---|---|---|---|
| 完整版(Windows) | docker-compose up -d | asr / tts / gen-video 三个 | 常规创作,8 种语言 TTS(中、英、日、韩、法、德、阿、西) |
| 轻量版 lite | docker-compose -f docker-compose-lite.yml up -d | 仅 gen-video | 显存紧张、或已有外部 TTS 只跑视频驱动 |
| 50 系列版 | docker-compose -f docker-compose-5090.yml up -d | tts(5090) / gen-video 两个 | RTX 50 系列显卡,基于 torch 预览版,30/40 系列部分 CUDA 12.8 用户也可用 |
两个容易忽略的配置:合成容器设置了 8G 的 shm_size,内存小的机器建议同时把 Docker 的内存上限调上去;磁盘方面,镜像加模型加数据,预留 100G 是官方口径的稳妥值,社区有反馈 10G 量级的模型、8G 显存也能跑,可以按自己机器情况试。
部署和使用中的常见坑位
Q:docker-compose up -d报 request canceled / connection 超时?Docker Hub 官方源在国内不稳定。在 Docker 的 daemon 配置里加国内 registry-mirrors(仓库 FAQ 里有一份可用列表),或走全局代理后重试。
Q:新增模特时报错,提示与视频相关?用于克隆的视频必须带人声、且是人在说话,程序要用这段声音做声音克隆;纯画面或音乐视频会失败。
Q:定制模特报 Connection refused?ASR 服务启动慢,服务端刚拉起就操作容易撞上,等几分钟重试即可;另外 16G 内存的机器 ASR 可能根本起不来。
Q:三个服务怎么也起不来?先跑nvidia-smi确认 NVIDIA 显卡和驱动正常,本项目没有 N 卡或驱动缺失时容器是无法启动的。
Q:Ubuntu 下用 root 双击 AppImage 没反应?在终端里加--no-sandbox参数启动即可,官方文档有说明。
Q:想换新版?服务端到deploy目录重新执行docker-compose up -d;项目更新比较频繁,不少旧问题在新版里已经修掉。
边界与入口
适合谁、不适合谁,一句话讲清:有 N 卡(8G 显存以上社区已有验证)、32G 内存、百 G 级硬盘,且在意素材不出本地或想二次开发的,值得花一个晚上把它跑起来;没有 N 卡、想零部署开箱即用、或只偶尔做一两条视频的,这个项目的维护成本对你就是负资产。
- 项目地址(clone 用):
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar - 部署文档:README_zh.md(Windows / Ubuntu / 50 系列三套安装说明都在里面)
- 常见问题:doc/常见问题.md
- 授权协议:LICENSE
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考