Duix.Avatar 数字人本地部署指南:10 秒视频克隆形象,一条命令跑通离线视频生成
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
想要做一个会说话的数字人口播视频,又不想把素材交给任何云端?Duix.Avatar 是一个真正开源的 AI 数字人工具包,主打全离线视频生成与数字人克隆:提交一段 10 秒左右的视频,形象和声音就能一起克隆;之后输入文案或上传音频,它会自动产出唇形同步的口播视频。整个过程跑在你自己的机器上,素材不经过任何服务器。
先说清楚:隐私和成本,是它存在的理由
大多数数字人平台的玩法是:上传素材到对方服务器,按生成时长付费,效果好不好看运气。如果你的场景涉及敏感素材(内部培训、客户内容、医疗法律话术),或者想长期批量产出视频,这套"交素材+付月租"的模式迟早会卡住你。
Duix.Avatar 的取向相反:克隆和合成全部在本地完成,不联网也能跑。你会问,代价是什么?代价就是你的机器得扛得住——所有算力压在本地,这意味着显卡、内存、磁盘都有门槛。下面两节先把"它是什么"和"机器要什么配置"讲透,再动手也不迟。
拆开看它是什么:客户端 + 三个 Docker 服务
整个系统分两层。一层是桌面客户端(Electron 写的图形界面),负责建模型、写文案、看进度;另一层是三个 Docker 服务,各管一段流水线:
| 服务 | 职责 | 大白话 |
|---|---|---|
guiji2025/fun-asr | 语音识别(ASR) | 把你样例视频里的语音转成文字 |
guiji2025/fish-speech-ziming | 语音合成(TTS) | 用你的声音克隆新语音 |
guiji2025/duix.avatar | 视频合成 | 把画面和语音对齐,生成口型 |
流水线串起来就是:10 秒样例视频先拆成静音视频 + 音频,ASR 把音频转成文本,TTS 拿它当声音样本,最后视频合成服务对着语音驱动口型,输出口播视频。所谓"数字人克隆",本质上是这三段接力。
动手前三道门槛:显卡、内存、磁盘
先别急着敲命令,这三条不满足,装得再快也起不来:
- NVIDIA 显卡 + 正确驱动,硬性要求。项目全部算力在本地,没有 N 卡或驱动没装好,三个服务一个都起不了。参考配置是 i5-13400F + 32G 内存 + RTX 4070;社区里有 16G 内存机器起不来 ASR 服务的反馈,内存别卡着下限买。
- Windows 磁盘分两块看:D 盘(存数字人和作品)留 30G 以上;C 盘(存服务镜像)留 100G 以上。
- 首次部署下载约 70G 镜像,按网速大概半小时,建议连 WiFi 等。
如果你确认 C 盘不够 100G,不用换电脑——装完 Docker 后可以在资源设置里把磁盘镜像文件挪到别的盘:
用 Docker 部署数字人的正确顺序
Windows 上推荐路径是:先装 WSL(wsl --install,装完用wsl --update更新),再装 Docker Desktop,最后到仓库的 deploy/ 目录起服务。compose 文件按场景选,别用错:
| 场景 | 启动命令 |
|---|---|
| 标准版(三个服务) | docker-compose up -d |
| 精简版(仅视频合成一个服务) | docker-compose -f docker-compose-lite.yml up -d |
| NVIDIA 50 系显卡(30/40 系 CUDA 12.8 也可用) | docker-compose -f docker-compose-5090.yml up -d |
| Ubuntu 22.04 | docker-compose -f docker-compose-linux.yml up -d |
起完在 Docker 里看到三个 Running 状态的服务就算成功;精简版只有一个Duix.Avatar-gen-video。客户端直接下官方构建的安装包即可:Windows 是 exe 安装包,Ubuntu 是 AppImage,双击就能跑。
三个最常卡住的点,提前给你答案
社区反馈里重复率最高的问题基本就这三个,对号入座:
docker-compose up -d拉镜像超时、报 connection 错误:不是你的网络断了,是 Docker Hub 官方源不稳。在 Docker 的引擎配置里加上registry-mirrors换镜像源(Linux 改/etc/docker/daemon.json),然后重启 Docker。新增模特报错:绝大多数情况是样例视频不合格——视频里必须有声音,且是人在说话。程序要靠这段声音做克隆,静音视频或纯音乐视频都会在这一步挂掉。
定制模特报 Connection refused:ASR 服务冷启动比较慢,服务端刚起来时别急着操作,等几分钟再克隆;内存偏小的机器还可能干脆起不来 ASR,先回到上一节核对配置。
排查时盯住服务日志就行,点开对应容器看 Logs 页签,报错关键行都会写在里面:
更完整的自查步骤(服务状态、驱动、版本)和提问模板,仓库里都整理好了:doc/常见问题.md。
跑起来之后:图形界面用,或 API 用
两条路线按需选。
走界面:打开客户端 → 创建模特(传 10 秒视频)→ 写文案或传音频 → 生成视频。文案支持八种语言:中、英、日、韩、法、德、阿拉伯语、西班牙语。作品和形象都列表化管理,右上角可以打开客户端日志:
走 API:Docker 起完会在本机http://127.0.0.1上暴露端口,模特训练、音频合成、视频合成三段各有一套接口(视频合成是提交任务 + 按 code 轮询进度两步)。想集成到自己的业务里,直接参考仓库里现成的调用代码:src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。
能力边界:它接什么,不接什么
把边界划清楚,才能判断这个工具适不适合你:
- 它接:离线形象/声音克隆、文本或语音驱动的唇形同步视频生成、多模型管理与批量产出。
- 它不接:实时交互式对话、移动端运行、非 NVIDIA 环境。
- 另一条路:不想自己维护 GPU 服务器的话,官方还提供数字人 API 服务——开源本地部署适合追求完全掌控、有深度学习经验的技术型用户(可改代码、全球免费商用,超大规模企业需签协议);API 服务适合专注上层应用、要企业级保障的业务型用户,免硬件但无法改源码,口型效果更高清。两条路线的完整对比见 README_zh.md。
下一步:按这个顺序做,少走弯路
- 先自查再提问:服务是否 Running、驱动是否装好、客户端和服务端是不是最新版,三步都过一遍再去翻 doc/常见问题.md。
- 需要源码时克隆仓库(
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar),通读 README_zh.md 了解部署流程与 API 细节。 - 硬件吃紧就先跑 lite 版验证链路通了,再上完整三服务。
- 遇到问题按模板反馈:复现步骤 + 截图 + 客户端和服务端日志,能省掉一半来回沟通的时间。
一句话收尾:硬件达标、顺序正确,Duix.Avatar 从克隆到成片就是"装 Docker → 起服务 → 传视频 → 等成片"四件事。离线、可控、免费商用,这套组合目前在同类型开源项目里相当能打。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考