news 2026/9/12 18:40:33

如何用Duix.Avatar免费打造你的AI数字分身:开源数字人本地部署实战指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何用Duix.Avatar免费打造你的AI数字分身:开源数字人本地部署实战指南

如何用Duix.Avatar免费打造你的AI数字分身:开源数字人本地部署实战指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

🧭 第一章:项目速览——它解决了什么问题

Duix.Avatar 是一个完全开源的 AI 数字人项目:上传一段 10 秒左右的真人说话视频,就能克隆你的形象和声音,再输入文本或音频驱动数字人,自动生成口型对齐的口播视频,全程在自己电脑上离线跑完,影像与声音数据不出本地。

它是一款全离线视频合成工具,适合自媒体创作者、讲师、企业市场团队,以及想给产品接入数字人能力的开发者。它带来的价值很直接:数字人制作从"数万美元、数周周期"降到"一台 32G 内存的电脑 + 一块 NVIDIA 显卡"。

传统做法用 Duix.Avatar
3D 建模加动捕流程,费用数万美元,周期数周10 秒真人视频,本地克隆形象与声音
素材要上传云端处理,影像数据存在泄露风险全离线运行,数据不离开设备

项目完全开源、免费商用(超大型企业的商用授权以仓库内许可协议为准),源码也能按你的需求直接改。

🚀 第二章:快速上手——5分钟跑起来

命令本身执行很快,但首次运行要下载约 70GB 的服务镜像,按网速留半小时到一小时。参考配置:32GB 内存、NVIDIA 显卡(仓库推荐 RTX 4070)、100GB 以上空闲磁盘,系统为 Windows 10 19042 及以上或 Ubuntu 22.04。

  1. 环境准备:先确认显卡驱动可用,再装好 Docker Desktop。💡 本项目算力 100% 在本地 GPU 上,没有 NVIDIA 显卡或驱动装错,后面三个服务都起不来。
    • 终端执行nvidia-smi,做完这步你应该看到显卡型号和驱动版本。
    • Windows 用户再检查一下 Docker Desktop 里 WSL2 磁盘镜像的位置:C 盘需留 100GB 以上,不够就在设置里换成空间更大的目录(位置如下图中框出处)。

  1. 获取代码:克隆仓库并进入部署目录。
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy

做完这步你应该看到 4 个 docker-compose 文件,分别对应不同部署模式。

  1. 一键启动:完整版一条命令即可,轻量版(只含视频合成服务)把文件名换成docker-compose-lite.yml就行。
docker-compose up -d # 启动完整三服务版 # 轻量版则执行: docker-compose -f docker-compose-lite.yml up -d

第一次运行大部分时间花在拉镜像,建议连 WiFi 耐心等待,不再滚动下载进度即完成。

  1. 验证成功:先看容器状态,再从仓库的发布页下载对应客户端安装包(Windows 是 setup 包,Ubuntu 是 AppImage)并启动。
docker ps

做完这步你应该看到 3 个容器处于 Running 状态:duix-avatar-tts(语音合成)、duix-avatar-asr(语音识别)、duix-avatar-gen-video(视频合成),轻量版只有最后一个。客户端打开后即是下面的主界面,左侧进入首页可看到"我的作品"和"我的数字人"两个列表。

🧩 第三章:核心能力拆解

形象克隆:10秒视频变数字资产

一句话定义:给系统一段 10 秒左右的真人说话视频,产出一个可反复使用的"形象 + 声音"模型。

具体流程是:你上传素材后,客户端把视频转成 H264 统一格式,用 ffmpeg 分离出音轨,把音频发给语音服务做 ASR 预处理,得到参考音频和参考文本两样关键产物;之后模特、视频、声音三条记录一并写进本地数据库。克隆完成后,这个数字人随时可以被选中、复用、删除。

你可以用它来给公司或个人 IP 建立一个"标准代言人",之后所有视频都用同一张脸、同一种声音出镜。

核心逻辑位于 src/main/service/model.js 与 src/main/service/voice.js。

视频生成:文本或音频驱动,自动对口型

一句话定义:输入文案或上传音频,数字人生成口型匹配的口播视频。

两个入口:直接在文本框输入台词,由克隆音色朗读;或上传现成音频文件驱动。任务按队列顺序提交,客户端每 2 秒轮询一次进度,成品视频落到"我的作品"里,支持在线播放和导出。文案支持中、英、日、韩、法、德、阿拉伯语、西班牙语 8 种语言。

你可以用它来批量生产知识口播:写好 10 条文案排队提交,回来收 10 条成片。

队列与进度逻辑在 src/main/service/video.js。

本地化管理:数据、模型、任务都留在自己手里

一句话定义:所有媒体与模型文件都存放在本机固定目录,任务状态记录在本地数据库中。

默认数据目录在 Windows 上是D:\duix_avatar_data(Linux 在用户主目录下的对应位置),按声音素材、模特作品分区存放;删除模型会连同对应文件一起清理,视频也能导出到任意位置,整个资产库完全由你掌控。

你可以用它来沉淀自己的数字人资产:一个形象、多段作品、多组声音,全部本地可查、可复用。

⚙️ 第四章:它是怎么做到的(架构与原理)

系统由三个容器加一个 Electron 客户端组成,数据链路是"输入 → 处理 → 输出"。以视频生成为例:输入是文案(或音频文件)加上模特素材视频;处理分两段——语音服务用克隆音色把文本读成 WAV,视频合成服务再按音频驱动模特画面做口型;输出是成片文件,写回本地"我的作品"。

最有技术含量的是素材处理链路(见 src/main/util/ffmpeg.js):输入一段 10 秒说话视频,客户端先把它转成 H264,再用 ffmpeg 拆成"静音视频 + 音频"。静音视频是数字人的"底板",音频送去识别服务转写成文本,与音频一起成为声音的参考对。之后每次合成语音,客户端都带着这对参考文件和目标文本调用语音服务:

{ "speaker": "唯一uuid", "text": "要合成的口播文案", "format": "wav", "reference_audio": "模特训练返回的 asr_format_audio_url", "reference_text": "模特训练返回的 reference_audio_text" }

也就是说,"声音克隆"并没有往云端传什么模型,本质就是"参考音频 + 参考文本"这一对凭据,每次合成时模型照着参考样本的音色实时发声。这也解释了为什么素材视频必须有声音、必须有人在说话。

部署侧对应四个 compose 文件(都在 deploy/ 目录),按硬件挑一个:

部署文件包含服务容器数适用场景
docker-compose.yml语音合成 + 语音识别 + 视频合成3Windows 完整功能
docker-compose-lite.yml仅视频合成1只生成视频,省资源
docker-compose-linux.yml三个服务3Ubuntu 22.04
docker-compose-5090.yml三个服务3NVIDIA 50 系(30/40 系开 CUDA 12.8 也可)

理解了原理,接下来看看实际能做什么。

🎬 第五章:实战场景与进阶玩法

自媒体口播生产

个人创作者把 Duix.Avatar 当成"个人演播室":录 10 秒自己说话的视频完成克隆,之后每天把口播文案丢进去,自动产出带自己脸和自己声音的成片。相比拍摄加剪辑,流程缩短到"写稿 + 点生成",更新频率和稳定性都更容易保证。

企业统一 IP 与课程制作

市场团队和教培机构可以把一个"虚拟代言人"固定为品牌统一形象:产品讲解、新人培训、课程录制都由同一个数字人完成,形象与音色始终一致。新内容只是新文本,不用重新拍摄,素材也不出内网,合规压力小很多。

多语言内容本地化

文案支持 8 种语言,同一段中文原稿可以转成日语、韩语、英语版本。对做跨境业务和出海自媒体的团队来说,一次素材投入、多语言分发,口型还会随新语言的音频自动匹配。

二次开发:把数字人能力接进自己的应用

服务启动后,仓库直接暴露本地 API(详见 README_zh.md 的"开放 API"小节):视频合成接口是http://127.0.0.1:8383/easy/submit,进度查询用同端口的easy/query。最小调用长这样:

const res = await fetch('http://127.0.0.1:8383/easy/submit', { method: 'POST', headers: { 'Content-Type': 'application/json' }, body: JSON.stringify({ audio_url: 'D:/duix_avatar_data/face2face/temp/audio.wav', video_url: 'D:/duix_avatar_data/face2face/temp/model.mp4', code: 'task-001' }) })

基于这个端点,你可以搭批量生成工作流、内容后台插件或私有化工具。跑批量长任务时建议盯一下服务容器日志,方便第一时间发现异常:

🛟 第六章:踩坑速查

docker-compose up -d拉镜像报连接超时?别急,大概率是 Docker Hub 官方源连不通。在 Docker Desktop 的守护进程 JSON 配置里加上registry-mirrors国内镜像源(仓库常见问题文档里给了可用列表),保存后等 Docker 重启;或者开全局代理。

  • 验证:docker images
  • 预期:看到 3 个guiji2025开头的镜像,容器正常启动。

三个服务起不来或反复重启?别急,大概率是机器上没有 NVIDIA 显卡、或驱动没装好——本项目算力全在本地。

  • 验证:nvidia-smi
  • 预期:显示显卡型号和驱动版本;命令不存在或报错就去装驱动,再重启 Docker。

定制模特报 Connection refused?别急,大概率是语音识别服务启动慢还没就绪(内存小于 32GB 也可能起不来)。

  • 验证:docker logs duix-avatar-asr
  • 预期:服务端启动后等几分钟再操作克隆;日志能看到服务就绪信息。

新增模特失败,提示和音频有关?别急,大概率是素材视频没有声音或没有人说话——声音克隆必须依赖音频。

  • 处理:重录素材,10 秒左右、面部清晰、连续说话。
  • 预期:训练成功,数字人出现在"我的数字人"列表。

📌 以上都没解决,先打开 doc/常见问题.md 对照自查,再看容器日志的最后一行报错,把这一行连同复现步骤带上提问。

📚 第七章:资源索引

Duix.Avatar 把数字人制作从"数万美元流程"压缩到"10 秒视频 + 一条命令",全离线、开源、免费商用。现在打开终端,跑通第二章的第一步,一小时内你就会拥有一个会说话的 AI 数字分身。

  • 中文完整文档:README_zh.md
  • 官方常见问题与自查清单:doc/常见问题.md
  • 部署配置文件:deploy/
  • 客户端核心服务与 API 参考:src/main/service/

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 16:52:58

没有 N 卡也能跑 CUDA:ZLUDA 让你的 GPU 一步到位

没有 N 卡也能跑 CUDA:ZLUDA 让你的 GPU 一步到位 【免费下载链接】ZLUDA CUDA on non-NVIDIA GPUs 项目地址: https://gitcode.com/GitHub_Trending/zl/ZLUDA 手里有一台 Intel GPU 的机器,却要运行一堆硬依赖 CUDA 的应用——这是不少人的日常困…

作者头像 李华
网站建设 2026/9/11 16:52:38

欧盟产品合规指南:CE标志、REACH与RoHS解析

1. 出口欧盟产品合规的核心框架当你的产品要进入欧盟市场时,遇到的第一个问题往往是:到底需要满足哪些要求?欧盟的产品合规体系就像一座精密运转的机器,由多个相互关联的法规和指令组成。我经手过的几十个出口案例表明&#xff0c…

作者头像 李华
网站建设 2026/9/11 16:52:34

CentOS服务器安全加固实战:云锁安装配置与踩坑记录

大概两年前,我一个朋友的业务服务器被挂马,整站首页被改成乱码页面,数据库差点被人拖走。那次我过去帮忙排查,翻了一晚上日志,最后确认是Tomcat管理后台弱口令被爆破,攻击者上传了Webshell,进程…

作者头像 李华