news 2026/9/11 5:04:54

Duix.Avatar 快速部署教程:从零做出第一个数字人口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar 快速部署教程:从零做出第一个数字人口播视频

Duix.Avatar 快速部署教程:从零做出第一个数字人口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个完全离线运行的开源数字人工具:上传一段 10 秒左右的说话视频,它就能克隆你的形象和声音,再输入文案或上传音频,即可生成口型匹配的播报视频。本文写给没接触过命令行和容器概念的读者,读完后你能把本地三个服务全部跑起来,并用客户端做出第一支数字人口播视频。

部署前自查:硬件与 Docker 先确认

项目要求说明
系统Windows 10(19042.1526 及以上)或 Ubuntu 22.04 桌面版其他 Linux 版本官方未验证
显卡英伟达显卡并已装好驱动必需项。命令行执行nvidia-smi,能显示显卡信息即通过
内存32GB 及以上16G 可能导致语音识别服务起不来
磁盘空闲空间 100GB 以上存放 Docker 镜像和模型文件
预装软件DockerWindows 装 Docker Desktop;Ubuntu 装 docker 与 docker-compose。docker --version已有输出即可跳过

如果 C 盘空闲不足 100GB,装好 Docker Desktop 后可以改镜像存放位置:Settings → Resources → Disk image location,点 Browse 换到空间充足的盘。

环境确认好了,接下来先解决下载速度。

🐳 配置 Docker 镜像加速

项目要拉 3 个镜像包,合计约 70GB。Docker 默认走国外官方源,国内网络很容易中断。解决办法是配置镜像加速源,也就是让 Docker 改从国内的转发渠道拉取。

点 Docker Desktop 右上角齿轮进设置,找到 Docker Engine,在页面里的 JSON 加上registry-mirrors字段填入加速源地址,然后点 Apply & restart。

怎么算配好了:Docker 重启后,后续拉镜像不再出现 request canceled 这类连接中断报错,就说明这一步到位了。

📦 拉取项目代码

打开命令行(Windows 上是 PowerShell),进入想存放项目的目录,执行:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

命令无报错跑完、当前目录下出现 Duix-Avatar 文件夹,说明拉取成功。

🚀 启动三个后端服务

项目的算力全在三个容器里:asr 做语音识别,tts 做语音合成,gen-video 做视频生成,启动配置都在 deploy 目录。执行:

cd deploy docker-compose up -d

首次运行会花半小时左右下载镜像,在 Docker Desktop 里能看到下载进度。成功后容器列表里 Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video 三个服务都是 Running,服务端就算就绪。内存紧张的话,可改用同目录的 docker-compose-lite.yml 启动精简版,只起一个视频生成服务。

💻 安装客户端并确认主页

从项目发布页下载官方构建的安装包(Windows 版为 Duix.Avatar-x.x.x-setup.exe),双击安装即可;如果你已有 Node.js 18,也可以直接用源码打包。装完双击桌面快捷方式进入主页,能看到"创建视频"和"创建数字人"两张卡片,说明环境已全部就绪。

首次上手:克隆数字人并生成第一条口播视频

服务刚起完先等几分钟,asr 服务完全就绪比较慢,马上做形象克隆容易报 Connection refused。

主页上方紫色卡片是 Create Video,用来输入文字或上传音频驱动数字人说话;右侧蓝色卡片是 Create Avatar,用来上传真人视频创建数字人形象。下方"我的作品"和"我的数字人"两个页签,分别存放已生成的视频和克隆好的形象。

先点 Create Avatar:上传一段 10 秒左右、正面说话的清晰视频。注意视频必须带声音轨道且人在说话,因为程序要用这段声音做声音克隆。提交后等克隆完成,"我的数字人"页签会出现新的形象卡片。

再点 Create Video:选中刚建好的数字人,输入口播文案或上传音频文件,提交合成。完成后,口型匹配的口播视频就出现在"我的作品"里,可以直接预览和下载。

故障速查:高频问题对照表

出错先看日志:客户端右上角 Setting → 打开日志,会直接定位到客户端日志文件 main.log;服务端日志则在 Docker Desktop 对应容器的 Logs 页签查看。

现象可能原因解决办法
docker-compose up -d 报 request canceledDocker Hub 官方源连接中断配置 registry-mirrors 镜像加速,Apply & restart
服务起不来或反复重启无英伟达显卡或驱动未装好nvidia-smi 检查,装好驱动后重启 Docker
新增数字人失败上传视频无声音或没有人说话重录 10 秒清晰说话的视频再传
克隆形象报 Connection refusedASR 服务未就绪或内存不足服务启动后等几分钟再操作;内存建议 32G

更多边缘问题可参考仓库里的常见问题文档。

想再深入的话,服务端的形象训练、音频合成、视频合成接口在核心源码里都有现成的调用示例,对照着看一遍就能理解整个链路。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 5:04:43

PostgreSQL版本选择与升级迁移:从选型到实战的完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 5:04:39

微服务异步事件总线设计:可靠投递与高可用实战

微服务架构折腾到现在,注册发现、配置中心、网关、熔断限流这些基础设施已经算不上什么新鲜事了。真正让人头疼的,恰恰是服务之间的数据一致性和异步协作问题。我见过太多团队把服务拆得稀碎,结果一次下单请求串联调用七八个服务,…

作者头像 李华
网站建设 2026/9/11 5:03:02

振动环境下接近感知系统的抗干扰优化方案

1. 振动源干扰下的接近感知挑战在工业自动化、机器人导航和智能安防等领域,接近感知系统常面临振动环境下的误判问题。当振动源与传感器距离小于1米时,传统基于单一信号强度的接近检测算法会出现高达30%的误报率。去年我们在汽车装配线上部署的接近传感器…

作者头像 李华
网站建设 2026/9/11 5:01:51

树莓派Pico低功耗实战:休眠API与功耗优化全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 5:00:49

V93000与SmarTest 8入门:从零构建ATE测试程序的完整路径

干这行的人迟早会撞上一台叫V93000的机器。我当年刚转做ATE测试工程师,第一次踏进实验室看到测试头展开的样子,说实话挺震撼——几层板卡密密麻麻插在一起,旁边立着Linux工作站,上面跑着一个叫SmarTest的软件。带我的老工程师丢给…

作者头像 李华