如何用Duix.Avatar免费打造你的AI数字分身:开源数字人本地部署实战指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
🧭 第一章:项目速览——它解决了什么问题
Duix.Avatar 是一个完全开源的 AI 数字人项目:上传一段 10 秒左右的真人说话视频,就能克隆你的形象和声音,再输入文本或音频驱动数字人,自动生成口型对齐的口播视频,全程在自己电脑上离线跑完,影像与声音数据不出本地。
它是一款全离线视频合成工具,适合自媒体创作者、讲师、企业市场团队,以及想给产品接入数字人能力的开发者。它带来的价值很直接:数字人制作从"数万美元、数周周期"降到"一台 32G 内存的电脑 + 一块 NVIDIA 显卡"。
| 传统做法 | 用 Duix.Avatar |
|---|---|
| 3D 建模加动捕流程,费用数万美元,周期数周 | 10 秒真人视频,本地克隆形象与声音 |
| 素材要上传云端处理,影像数据存在泄露风险 | 全离线运行,数据不离开设备 |
项目完全开源、免费商用(超大型企业的商用授权以仓库内许可协议为准),源码也能按你的需求直接改。
🚀 第二章:快速上手——5分钟跑起来
命令本身执行很快,但首次运行要下载约 70GB 的服务镜像,按网速留半小时到一小时。参考配置:32GB 内存、NVIDIA 显卡(仓库推荐 RTX 4070)、100GB 以上空闲磁盘,系统为 Windows 10 19042 及以上或 Ubuntu 22.04。
- 环境准备:先确认显卡驱动可用,再装好 Docker Desktop。💡 本项目算力 100% 在本地 GPU 上,没有 NVIDIA 显卡或驱动装错,后面三个服务都起不来。
- 终端执行
nvidia-smi,做完这步你应该看到显卡型号和驱动版本。 - Windows 用户再检查一下 Docker Desktop 里 WSL2 磁盘镜像的位置:C 盘需留 100GB 以上,不够就在设置里换成空间更大的目录(位置如下图中框出处)。
- 终端执行
- 获取代码:克隆仓库并进入部署目录。
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy做完这步你应该看到 4 个 docker-compose 文件,分别对应不同部署模式。
- 一键启动:完整版一条命令即可,轻量版(只含视频合成服务)把文件名换成
docker-compose-lite.yml就行。
docker-compose up -d # 启动完整三服务版 # 轻量版则执行: docker-compose -f docker-compose-lite.yml up -d第一次运行大部分时间花在拉镜像,建议连 WiFi 耐心等待,不再滚动下载进度即完成。
- 验证成功:先看容器状态,再从仓库的发布页下载对应客户端安装包(Windows 是 setup 包,Ubuntu 是 AppImage)并启动。
docker ps做完这步你应该看到 3 个容器处于 Running 状态:duix-avatar-tts(语音合成)、duix-avatar-asr(语音识别)、duix-avatar-gen-video(视频合成),轻量版只有最后一个。客户端打开后即是下面的主界面,左侧进入首页可看到"我的作品"和"我的数字人"两个列表。
🧩 第三章:核心能力拆解
形象克隆:10秒视频变数字资产
一句话定义:给系统一段 10 秒左右的真人说话视频,产出一个可反复使用的"形象 + 声音"模型。
具体流程是:你上传素材后,客户端把视频转成 H264 统一格式,用 ffmpeg 分离出音轨,把音频发给语音服务做 ASR 预处理,得到参考音频和参考文本两样关键产物;之后模特、视频、声音三条记录一并写进本地数据库。克隆完成后,这个数字人随时可以被选中、复用、删除。
你可以用它来给公司或个人 IP 建立一个"标准代言人",之后所有视频都用同一张脸、同一种声音出镜。
核心逻辑位于 src/main/service/model.js 与 src/main/service/voice.js。
视频生成:文本或音频驱动,自动对口型
一句话定义:输入文案或上传音频,数字人生成口型匹配的口播视频。
两个入口:直接在文本框输入台词,由克隆音色朗读;或上传现成音频文件驱动。任务按队列顺序提交,客户端每 2 秒轮询一次进度,成品视频落到"我的作品"里,支持在线播放和导出。文案支持中、英、日、韩、法、德、阿拉伯语、西班牙语 8 种语言。
你可以用它来批量生产知识口播:写好 10 条文案排队提交,回来收 10 条成片。
队列与进度逻辑在 src/main/service/video.js。
本地化管理:数据、模型、任务都留在自己手里
一句话定义:所有媒体与模型文件都存放在本机固定目录,任务状态记录在本地数据库中。
默认数据目录在 Windows 上是D:\duix_avatar_data(Linux 在用户主目录下的对应位置),按声音素材、模特作品分区存放;删除模型会连同对应文件一起清理,视频也能导出到任意位置,整个资产库完全由你掌控。
你可以用它来沉淀自己的数字人资产:一个形象、多段作品、多组声音,全部本地可查、可复用。
⚙️ 第四章:它是怎么做到的(架构与原理)
系统由三个容器加一个 Electron 客户端组成,数据链路是"输入 → 处理 → 输出"。以视频生成为例:输入是文案(或音频文件)加上模特素材视频;处理分两段——语音服务用克隆音色把文本读成 WAV,视频合成服务再按音频驱动模特画面做口型;输出是成片文件,写回本地"我的作品"。
最有技术含量的是素材处理链路(见 src/main/util/ffmpeg.js):输入一段 10 秒说话视频,客户端先把它转成 H264,再用 ffmpeg 拆成"静音视频 + 音频"。静音视频是数字人的"底板",音频送去识别服务转写成文本,与音频一起成为声音的参考对。之后每次合成语音,客户端都带着这对参考文件和目标文本调用语音服务:
{ "speaker": "唯一uuid", "text": "要合成的口播文案", "format": "wav", "reference_audio": "模特训练返回的 asr_format_audio_url", "reference_text": "模特训练返回的 reference_audio_text" }也就是说,"声音克隆"并没有往云端传什么模型,本质就是"参考音频 + 参考文本"这一对凭据,每次合成时模型照着参考样本的音色实时发声。这也解释了为什么素材视频必须有声音、必须有人在说话。
部署侧对应四个 compose 文件(都在 deploy/ 目录),按硬件挑一个:
| 部署文件 | 包含服务 | 容器数 | 适用场景 |
|---|---|---|---|
| docker-compose.yml | 语音合成 + 语音识别 + 视频合成 | 3 | Windows 完整功能 |
| docker-compose-lite.yml | 仅视频合成 | 1 | 只生成视频,省资源 |
| docker-compose-linux.yml | 三个服务 | 3 | Ubuntu 22.04 |
| docker-compose-5090.yml | 三个服务 | 3 | NVIDIA 50 系(30/40 系开 CUDA 12.8 也可) |
理解了原理,接下来看看实际能做什么。
🎬 第五章:实战场景与进阶玩法
自媒体口播生产
个人创作者把 Duix.Avatar 当成"个人演播室":录 10 秒自己说话的视频完成克隆,之后每天把口播文案丢进去,自动产出带自己脸和自己声音的成片。相比拍摄加剪辑,流程缩短到"写稿 + 点生成",更新频率和稳定性都更容易保证。
企业统一 IP 与课程制作
市场团队和教培机构可以把一个"虚拟代言人"固定为品牌统一形象:产品讲解、新人培训、课程录制都由同一个数字人完成,形象与音色始终一致。新内容只是新文本,不用重新拍摄,素材也不出内网,合规压力小很多。
多语言内容本地化
文案支持 8 种语言,同一段中文原稿可以转成日语、韩语、英语版本。对做跨境业务和出海自媒体的团队来说,一次素材投入、多语言分发,口型还会随新语言的音频自动匹配。
二次开发:把数字人能力接进自己的应用
服务启动后,仓库直接暴露本地 API(详见 README_zh.md 的"开放 API"小节):视频合成接口是http://127.0.0.1:8383/easy/submit,进度查询用同端口的easy/query。最小调用长这样:
const res = await fetch('http://127.0.0.1:8383/easy/submit', { method: 'POST', headers: { 'Content-Type': 'application/json' }, body: JSON.stringify({ audio_url: 'D:/duix_avatar_data/face2face/temp/audio.wav', video_url: 'D:/duix_avatar_data/face2face/temp/model.mp4', code: 'task-001' }) })基于这个端点,你可以搭批量生成工作流、内容后台插件或私有化工具。跑批量长任务时建议盯一下服务容器日志,方便第一时间发现异常:
🛟 第六章:踩坑速查
docker-compose up -d拉镜像报连接超时?别急,大概率是 Docker Hub 官方源连不通。在 Docker Desktop 的守护进程 JSON 配置里加上registry-mirrors国内镜像源(仓库常见问题文档里给了可用列表),保存后等 Docker 重启;或者开全局代理。
- 验证:
docker images - 预期:看到 3 个
guiji2025开头的镜像,容器正常启动。
三个服务起不来或反复重启?别急,大概率是机器上没有 NVIDIA 显卡、或驱动没装好——本项目算力全在本地。
- 验证:
nvidia-smi - 预期:显示显卡型号和驱动版本;命令不存在或报错就去装驱动,再重启 Docker。
定制模特报 Connection refused?别急,大概率是语音识别服务启动慢还没就绪(内存小于 32GB 也可能起不来)。
- 验证:
docker logs duix-avatar-asr - 预期:服务端启动后等几分钟再操作克隆;日志能看到服务就绪信息。
新增模特失败,提示和音频有关?别急,大概率是素材视频没有声音或没有人说话——声音克隆必须依赖音频。
- 处理:重录素材,10 秒左右、面部清晰、连续说话。
- 预期:训练成功,数字人出现在"我的数字人"列表。
📌 以上都没解决,先打开 doc/常见问题.md 对照自查,再看容器日志的最后一行报错,把这一行连同复现步骤带上提问。
📚 第七章:资源索引
Duix.Avatar 把数字人制作从"数万美元流程"压缩到"10 秒视频 + 一条命令",全离线、开源、免费商用。现在打开终端,跑通第二章的第一步,一小时内你就会拥有一个会说话的 AI 数字分身。
- 中文完整文档:README_zh.md
- 官方常见问题与自查清单:doc/常见问题.md
- 部署配置文件:deploy/
- 客户端核心服务与 API 参考:src/main/service/
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考