news 2026/9/12 9:27:11

SadTalker 安装与配置:5 步跑通音频驱动面部动画生成

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
SadTalker 安装与配置:5 步跑通音频驱动面部动画生成

SadTalker 安装与配置:5 步跑通音频驱动面部动画生成

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

SadTalker 是一个 CVPR 2023 的音频驱动面部动画系统,输入一张人像照片加一段音频,输出说话人视频。本文给出 SadTalker 安装的一条完整落地路径:按硬件选路、一条命令式流程搭好环境、模型下载与校验、首次推理命令,外加一张按报错关键词组织的问题速查表。全部命令基于仓库真实脚本,可直接复制。

一、选路:你的硬件走哪条路

这一节帮你判断走 GPU 还是 CPU。做完你能明确自己的部署路线。

对比项GPU 路线CPU 路线
硬件要求NVIDIA GPU,建议 4GB 显存起步任意 x86/ARM CPU
依赖CUDA 11.3 版 PyTorchPyTorch CPU 版
内存16GB 内存建议 32GB 内存
10 秒音频量级耗时10–30 秒3–8 分钟

结论:有 4GB 以上显存的 NVIDIA 显卡就直接走 GPU;没有显卡的机器走 CPU 兜底,结果一致,只是慢一个量级。设备是自动检测的,inference.py 发现 CUDA 可用就分配给 GPU,加--cpu参数才强制走 CPU。

选好路线,下一步把环境搭起来。

二、一条命令式流程搭好 SadTalker 运行环境

这一节按顺序执行 5 个步骤。做完你的 conda 环境能直接加载全部依赖,torch.cuda.is_available()返回True

  1. 克隆仓库并创建 conda 环境:
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python=3.8 conda activate sadtalker
  1. 按 CUDA 分支装 PyTorch(CUDA 11.3 或 CPU 二选一):
# CUDA 11.3 pip install torch==1.12.1+cu113 torchvision==0.13.1+cu113 torchaudio==0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 # CPU 兜底 pip install torch==1.12.1+cpu torchvision==0.13.1+cpu torchaudio==0.12.1 --extra-index-url https://download.pytorch.org/whl/cpu
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"
  1. 安装 FFmpeg:
conda install ffmpeg
ffmpeg -version
  1. 安装依赖(清单见 requirements.txt):
pip install -r requirements.txt

跑 Gradio 网页演示需要额外装 Coqui TTS:pip install TTS

  1. 环境自检:
python -c "import numpy, librosa, face_alignment; print('OK')"

环境就绪后,还差预训练模型这一环。

三、模型文件下载清单与校验

这一节把模型下到正确位置。做完你的项目目录下会出现checkpoints/gfpgan/weights/两个目录,且每个文件的大小符合预期。

文件位置大小用途
SadTalker_V0.0.2_256.safetensorscheckpoints/约 1.2GB256 分辨率面部渲染主模型
SadTalker_V0.0.2_512.safetensorscheckpoints/约 1.2GB512 分辨率面部渲染主模型
mapping_00229-model.pth.tarcheckpoints/约 200MBcrop 模式 MappingNet
mapping_00109-model.pth.tarcheckpoints/约 200MBfull 模式 MappingNet
alignment_WFLW_4HG.pthgfpgan/weights/数十 MBfacexlib 面部对齐
detection_Resnet50_Final.pthgfpgan/weights/数十 MBfacexlib 人脸检测
GFPGANv1.4.pthgfpgan/weights/约 300MBGFPGAN 人脸增强
parsing_parsenet.pthgfpgan/weights/数十 MB面部解析

两种下载方式。方式一:Linux/macOS 直接运行仓库自带的下载脚本,自动建目录并拉取全部文件:

bash scripts/download_models.sh

方式二:手动下载。在 Releases 页面下载核心模型,放入checkpoints/,另下载 GFPGAN 离线补丁包,解压后覆盖到项目根目录的gfpgan/。注意两个 mapping 文件要下全:src/utils/init_path.py 按--preprocess是否为 full 模式二选一加载。

下载后校验完整性:

du -h checkpoints/*.safetensors checkpoints/*.pth.tar du -h gfpgan/weights/*.pth

safetensors 文件应在 1.2GB 量级,两个 pth.tar 在 200MB 量级。明显偏小说明下载不完整,用wget -nc断点续传补齐。

模型就位,下面跑第一次推理。

四、跑通 SadTalker 第一次推理

这一节用最少参数生成第一条视频。做完results/下会出现一个时间戳目录,里面是一条带口型动画的 mp4。

最小参数集:

python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/art_0.png \ --enhancer gfpgan

仓库自带示例音频和示例人像,可直接使用。

两个关键参数。--size:选 256 还是 512 分辨率主模型,init_path 会自动加载对应的SadTalker_V0.0.2_512.safetensors或 256 版本,默认 256;512 质量更好,显存需求更高。--enhancer gfpgan:用 GFPGAN 修复人脸细节,不需要增强就去掉。输入是全身照时,加--still --preprocess full保持原始头部姿态并贴回全身画面;只生成人脸特写就用默认 crop 模式。更多组合见 docs/best_practice.md。

ls results/

视频已生成,剩下就是性能预期和报错自查。

五、性能表现与报错关键词速查

这一节给耗时预期和按报错关键词组织的问题表。对照速查表,90% 的安装问题能直接定位。

硬件10 秒音频量级耗时
GPU10–30 秒
CPU3–8 分钟
报错关键词原因解法
CUDA out of memory显存不足--batch_size--size 256,或设PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128
ffmpeg is not recognizedFFmpeg 未装或不在 PATHconda install ffmpegffmpeg -version验证
unexpected EOF, The file might be corrupted模型下载不完整按清单表校验大小,重新下载
No such file or directory模型目录结构不对对照第三节目录结构检查 checkpoints/ 与 gfpgan/weights/
No module named 'ai'/Illegal Hardware多为 Mac M1 上 dlib 不兼容单独重装pip install dlib
Invalid data found when processing input音频格式不对输入只支持 wav 或 mp3

更完整的案例见 docs/FAQ.md。

环境、模型、推理三步落地后,SadTalker 的安装配置就算完成。 再遇到问题,回这张速查表按关键词查即可。

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 9:26:39

网文IP改编短剧AI工具选型:Runway与小云雀工作流深度对比

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 9:26:36

Java Swing管理系统源码解析与实战应用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 9:26:16

Spring Boot+Vue火锅店管理系统开发实践

1. 项目背景与核心价值 在餐饮行业数字化转型浪潮中,火锅店因其独特的经营模式面临着特殊的管理挑战。传统纸质点单和人工统计的方式常导致高峰期服务效率低下、库存管理混乱、经营数据分析滞后等问题。这套基于Spring BootVue的火锅店管理系统,正是为解…

作者头像 李华
网站建设 2026/9/12 9:26:14

AI原生游戏开发实战:Godot 4 + MCP打造自动化编码闭环

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 9:24:59

SpringBoot交通查询系统开发:从算法到架构实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华