news 2026/9/11 14:51:33

HeyGem.ai 教程:10秒视频克隆你的AI数字人,完全离线本地部署(完整部署指南)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
HeyGem.ai 教程:10秒视频克隆你的AI数字人,完全离线本地部署(完整部署指南)

HeyGem.ai 教程:10秒视频克隆你的AI数字人,完全离线本地部署(完整部署指南)

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

HeyGem.ai 数字人是一款完全开源、可离线运行的数字人工具:拍一段约10秒的你讲话的视频,它就能克隆你的外貌和声音,做成一个数字人,之后输入文案或上传音频,即可在本地生成口型匹配的口播视频,全程不联网。本文带你从硬件确认到出片,不需要技术背景。

你的电脑够格吗?一张表确认硬件门槛

动手前先对照这张表自查:

系统操作系统CPU内存显卡磁盘空间
WindowsWindows 10(19042.1526 或更高)第13代酷睿 i5-13400F 或更高32GB 及以上NVIDIA RTX 4070 或更高C 盘 100GB 以上、D 盘 30GB 以上
UbuntuUbuntu 22.04 Desktop同上同上同上同上

真正的硬门槛只有两个:32GB 内存装好驱动的 NVIDIA 显卡。所有算力都在本地跑,缺了这两样,服务根本起不来。

⚡ 30分钟搭好本地数字人工作室

第一步:准备 Docker 与 WSL

Docker 的作用是在你的机器上把多个服务装进"标准容器"里一键跑起来,不用操心环境冲突;WSL 是 Windows 自带的 Linux 子系统,是 Docker 运行的底座。先在终端执行这条命令更新子系统:

wsl --update

然后安装 Docker for Windows,首次启动时接受协议即可,登录可以跳过。

第二步:拉取镜像并一键启动三个服务

服务端由三个镜像组成:ASR(语音识别,把语音转成文字)、TTS(语音合成,把文字读成语音),以及视频生成服务。先把三个镜像拉下来:

docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar

镜像就位后,进入 deploy 目录启动:

cd deploy docker-compose up -d

首次运行会自动下载依赖,耐心等待约 30 分钟。三个容器全部变成 Running 状态,服务端就算就绪了。

第三步:安装客户端

下载官方构建的安装包,双击Duix.Avatar-x.x.x-setup.exe完成安装(Ubuntu 用户直接双击Duix.Avatar-x.x.x.AppImage运行)。打开客户端能看到"Create Video"和"Create Avatar"两个入口,说明环境全部打通。

从10秒视频到你的第一个数字人:数字人克隆四步走

① 素材准备

拍一段你自己讲话的视频,10 秒左右就够。程序会把它拆成静音视频和音频,其中音频要放到约定目录D:\duix_avatar_data\voice\data(可在 docker-compose 中修改)。

② 训练数字人

在客户端点"Create Avatar",选中你的视频。程序用你的外貌和声音特征训练模型,结果就是"My Avatars"里出现一个长着你脸、能发出你声音的数字人。

③ 合成语音

输入口播文案,客户端调用 TTS 服务把文字转成音频,音色就是你视频里克隆下来的那个声音,听起来像你自己说的。

④ 生成口型视频

客户端把音频和数字人模型配对,逐帧驱动口型,生成完成后,一条完整的本地口播视频就会出现在"My Works"作品列表里。

想接API?记住这3个端点

Docker 启动后会在本机开放端口,通过http://127.0.0.1就能调用,方便你二次开发:

功能端点地址用途说明
模特训练http://127.0.0.1:18180/v1/preprocess_and_train传入音频,返回后续合成要用的参考参数
音频合成http://127.0.0.1:18180/v1/invoke把文本合成为克隆音色的语音
视频合成http://127.0.0.1:8383/easy/submit音频加数字人生成口型视频,进度可查/easy/query

调用参数和完整流程都写在客户端源码 model.js、voice.js、video.js 里,对着这三个文件就能照搬。

高频翻车现场:5个坑与快速解法

  1. 三个服务没进入 Running→ 原因通常是 NVIDIA 驱动没装或装错,其次是内存不足起不来 → 解法:先验证显卡驱动,再确认内存达到 32GB。
  2. docker-compose up -d连接超时→ 原因是 Docker Hub 官方源连接不稳定 → 解法:开启全局代理,或在 Docker 里配置国内镜像源。
  3. 新增模特时报错→ 原因是素材视频没有声音、或画面里没有人讲话,声音克隆无从下手 → 解法:重拍一段口齿清晰的讲话视频。
  4. 定制模特报 Connection refused→ 原因是 ASR 服务启动慢,16G 小内存甚至可能直接启动不了 → 解法:服务端启动后等几分钟再操作克隆。
  5. 客户端与服务端版本不一致→ 原因是社区更新频繁,你停在旧版 → 解法:服务端到 deploy 目录重新执行docker-compose up -d,客户端升级到最新版,旧问题多半已在新版修复。

更多报错日志的查看位置,见仓库内的常见问题。

HeyGem.ai 其实适合这些人

选它理由有二:成本比传统 3D 数字人制作降低 99% 以上,且全流程离线、数据不出本机,没有隐私泄露风险。在线教育老师做课程视频、自媒体创作者做口播内容、企业宣传做介绍短片、想拥有个人数字形象的人,都能从一段 10 秒视频起步。

这段 10 秒视频是你唯一的投入,回报是一个 7×24 在本地为你工作的数字人。现在装好 Docker,按上面三步走,今天就能看到第一条口播视频。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 14:51:01

Linux多任务并发处理机制与实践指南

1. Linux多任务并发处理概述在Linux系统中,多任务并发处理能力是其核心优势之一。作为一名系统管理员,我经常需要处理同时运行数十个进程的场景。Linux通过精巧的进程调度机制和资源分配策略,使得单台服务器能够高效处理大量并发任务。现代服…

作者头像 李华
网站建设 2026/9/11 14:49:30

Spring Bean生命周期详解与实战应用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 14:49:22

Petrel许可证云化迁移:从FLEXlm到DELFI的实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 14:45:30

Arm-2D源码评测:Cortex-M上的软GPU图形加速库详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华