news 2026/9/11 8:30:24

本地数字人怎么跑起来:用10秒视频克隆形象,全程离线生成口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
本地数字人怎么跑起来:用10秒视频克隆形象,全程离线生成口播视频

本地数字人怎么跑起来:用10秒视频克隆形象,全程离线生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

把一段10秒左右的手机自拍视频交给 Duix.Avatar,它能克隆出你的形象和声音;之后输入一段文案,或直接上传自己的录音,就能得到一个口型同步的说话视频。整个过程在本机完成,不用把素材上传到云端——这是这个开源项目最值得先知道的一点。

它是什么,适合谁

Duix.Avatar 是一个全离线的数字人视频工具:服务端跑在 Docker 里(基于本地 NVIDIA 显卡),客户端是一个桌面程序,负责上传素材、录入文案、预览和导出。官方推荐配置是 i5-13400F、32G 内存、RTX 4070 级别显卡,磁盘预留 100G 以上;社区里有不少 8G 显存显卡跑通的反馈,显存需求在同类方案里算比较省。

它适合三类人:

  • 做课程、口播、产品演示,需要频繁更换文案但不想反复出镜录制的创作者;
  • 在意素材隐私、不想让视频和声音离开自己机器的用户;
  • 想基于开放 API 做二次开发、把数字人能力嵌进自己产品的开发者。

最低配置要求与最短启动路径

先说硬件底线,三条都是硬要求:

  • 有 NVIDIA 显卡并装好驱动(所有算力都在本地,没有 N 卡三个服务都起不来);
  • 内存 32G 及以上(16G 内存的机器 ASR 服务可能直接启动失败);
  • Windows 需要 D 盘空闲大于 30G、C 盘大于 100G(存镜像);Ubuntu 需要 100G 空闲磁盘。

服务端就是几条命令的事。以 Ubuntu 22.04 为例,装好 Docker 和 NVIDIA Container Toolkit 后:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose -f docker-compose-linux.yml up -d

Windows 用户在仓库的deploy目录直接执行docker-compose up -d即可。首次拉取镜像会消耗约 70G 流量,官方给出的等待时间是半小时左右,速度取决于你的网速,建议连 WiFi 耐心等。启动成功后 Docker 里会看到duix-avatar-asrduix-avatar-ttsduix-avatar-gen-video三个服务处于 Running 状态。

客户端不需要自己编译,从项目 Releases 页面下载官方构建的安装包:Windows 是 exe 安装程序,Linux 是 AppImage,双击即可。

核心能力拆解

形象 + 声音一次克隆。上传一段约10秒、有清晰人声的视频,程序会同时完成外貌建模和声纹克隆,之后这个人"开口"用的就是你的声音。适合需要统一出镜形象的团队。

文本、录音双驱动。生成视频时可以输入文案由 TTS 合成本人音色朗读,也可以直接上传一段录音(支持 mp3、wav 等,单条小于 30 分钟,官方提示用干声、避开背景音效果更好)。适合有现成脚本或已录好旁白的场景。

全离线,数据不出机器。从视频采集、预处理、克隆到合成导出,全程无网络交互,素材只存在本地磁盘。适合对隐私敏感的内容生产。

开放本地 API。Docker 启动后在 127.0.0.1 上暴露模特训练、音频合成、视频合成三类接口(端口 10095 / 18180 / 8383),源码在src/main/service/下有完整调用示例。适合想把数字人能力接进自有系统的开发者。

两个真实使用场景的复盘

第一次部署,卡在拉镜像。我在 Windows 上跟着文档走,docker-compose up -d执行后三个容器反复报错,日志里全是registry-1.docker.io连接超时——就是 Docker Hub 官方源在国内访问不稳定的老问题。处理办法是在 Docker Desktop 的 Docker Engine 设置里加上国内 registry 镜像源(官方常见问题里给了一份现成配置),改完 Apply and restart,重新拉取就顺了。

克隆第一步报 Connection refused。服务端刚拉起来我马上就上传视频做模特克隆,结果客户端直接报Connection refused,日志里能看到 ASR 服务还没建立连接。后来才明白 ASR 服务启动比较慢,官方建议服务端启动后等几分钟再做克隆操作。等了几分钟重试,克隆顺利通过,客户端首页就多了这个"数字分身"。

把课程口播搬回家。第二个场景是我录了一段 10 秒的正面说话视频(文档要求至少 8 秒、吐字清晰、必须带人声),克隆成功后,写一段讲稿贴进文案输入框,生成的视频里"我"的口型和讲稿逐句对应;换文案重新生成不需要再录任何东西。客户端首页的 My Avatars 和 My Works 分别管理克隆的形象和生成的作品,支持建多个形象切换,做系列内容时很方便。

硬件门槛与可选部署方案

服务端提供三份 compose 文件,按需选一个,不要混用:

方案启动命令(deploy 目录下)容器适用场景
完整版(Windows)docker-compose up -dasr / tts / gen-video 三个常规创作,8 种语言 TTS(中、英、日、韩、法、德、阿、西)
轻量版 litedocker-compose -f docker-compose-lite.yml up -d仅 gen-video显存紧张、或已有外部 TTS 只跑视频驱动
50 系列版docker-compose -f docker-compose-5090.yml up -dtts(5090) / gen-video 两个RTX 50 系列显卡,基于 torch 预览版,30/40 系列部分 CUDA 12.8 用户也可用

两个容易忽略的配置:合成容器设置了 8G 的 shm_size,内存小的机器建议同时把 Docker 的内存上限调上去;磁盘方面,镜像加模型加数据,预留 100G 是官方口径的稳妥值,社区有反馈 10G 量级的模型、8G 显存也能跑,可以按自己机器情况试。

部署和使用中的常见坑位

Q:docker-compose up -d报 request canceled / connection 超时?Docker Hub 官方源在国内不稳定。在 Docker 的 daemon 配置里加国内 registry-mirrors(仓库 FAQ 里有一份可用列表),或走全局代理后重试。

Q:新增模特时报错,提示与视频相关?用于克隆的视频必须带人声、且是人在说话,程序要用这段声音做声音克隆;纯画面或音乐视频会失败。

Q:定制模特报 Connection refused?ASR 服务启动慢,服务端刚拉起就操作容易撞上,等几分钟重试即可;另外 16G 内存的机器 ASR 可能根本起不来。

Q:三个服务怎么也起不来?先跑nvidia-smi确认 NVIDIA 显卡和驱动正常,本项目没有 N 卡或驱动缺失时容器是无法启动的。

Q:Ubuntu 下用 root 双击 AppImage 没反应?在终端里加--no-sandbox参数启动即可,官方文档有说明。

Q:想换新版?服务端到deploy目录重新执行docker-compose up -d;项目更新比较频繁,不少旧问题在新版里已经修掉。

边界与入口

适合谁、不适合谁,一句话讲清:有 N 卡(8G 显存以上社区已有验证)、32G 内存、百 G 级硬盘,且在意素材不出本地或想二次开发的,值得花一个晚上把它跑起来;没有 N 卡、想零部署开箱即用、或只偶尔做一两条视频的,这个项目的维护成本对你就是负资产。

  • 项目地址(clone 用):git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar
  • 部署文档:README_zh.md(Windows / Ubuntu / 50 系列三套安装说明都在里面)
  • 常见问题:doc/常见问题.md
  • 授权协议:LICENSE

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 8:28:39

EV录屏实战指南:免费屏幕录制、直播推流与视频后期处理全流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 8:27:08

Context Mode上下文模式:大模型输出不稳定的根源与实战方案

最近在折腾一个内部 AI 工具,遇到一个特别典型的场景:同一个模型,代码生成、文档问答、数据分析都要用,结果发现不管我怎么调提示词,输出质量都不稳定。一会儿还挺靠谱,一会儿就东拉西扯,甚至把…

作者头像 李华
网站建设 2026/9/11 8:25:27

研发做App宣传图,免费在线工具+模板全流程实操指南

做开发这么多年,我最怕的不是需求改来改去,而是某天运营同事突然在群里喊一句:“咱们App下周要上推荐位,你能出一张宣传图吗?”这个场景我相信不少研发都经历过。手里正排着接口联调的任务,嘴上还得说“行&…

作者头像 李华
网站建设 2026/9/11 8:25:23

deer-flow实战:AI工作流编排与Agent应用落地指南

最近在给团队搭AI Agent项目,试了一圈工作流编排工具,最后真正留在生产环境里的,反而是个看起来不起眼的开源项目——deer-flow。它解决的是我过去最头疼的问题:单次调用大模型很简单,但一旦涉及多步任务、工具调用、条…

作者头像 李华