GPT-SoVITS 快速上手教程:零基础 1 分钟克隆专属声音的完整文本转语音指南
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
GPT-SoVITS 是一款开源免费的文本转语音(TTS)项目,核心能力是声音克隆:给它 1 分钟语音,它就能学会用这个声音朗读任意文字。适合不懂代码、不了解 AI 的你——无论是想给播客打造品牌声音,还是让游戏角色开口说话,都能用得上。下面我用几分钟带你把它从零跑起来,顺手避开新手最容易踩的坑,最后聊聊怎么把它用到实处。
为什么值得试:6 个亮点一次看完
先给你吃颗定心丸:这个项目对新手非常友好,几乎全程点点鼠标就能走完。它的好,可以浓缩成下面这张表👇
| 特性点 | 对你意味着什么 | 帮你省掉什么 |
|---|---|---|
| 1 分钟语音即可微调出专属模型 | 手机录 1 分钟日常说话就能开练 | 省掉专业录音棚和大批量录音的时间成本 |
| 5 秒声音零样本试听 | 还没训练就能立刻"试水",听听像不像 | 省掉"先训几个小时才有结果"的等待 |
| 中/英/日/韩/粤 5 语种支持 | 用中文训练的模型也能朗读其他语言 | 省掉为每种语言单独准备语料 |
| WebUI 图形化界面 | 从切音频到出模型全程点选完成 | 省掉写代码、配参数的门槛 |
| 内置数据集工具链 | 自动切片、降噪、语音识别转写文本 | 省掉手动剪音频、手动听写标注的活儿 |
| MIT 开源免费 + 推理很快 | 个人商用均免费,4090 上约 3.4 秒合成 4 分钟音频 | 省掉商业软件授权费和排队等待 |
第一次上手:三步走,先听到第一段声音
这一节的目标只有一个:让你今天就把 WebUI 跑起来,听到第一段克隆语音。你只需要三步,剩下的交给系统。
第 1 步:拿到项目并安装环境 📦
Windows 用户最省事:下载官方 Windows 整合包(README.md 的 Installation 一节有入口),解压后双击go-webui.bat就直接启动了,无需任何配置。Linux / macOS 用户则在项目目录里执行一次安装脚本,它会自动装依赖并下载预训练模型(国内网络把--source换成ModelScope更快):
conda create -n GPTSoVits python=3.10 conda activate GPTSoVits bash install.sh --device CU128 --source ModelScope --download-uvr5如果 conda 安装顺利,预训练模型(GPT_SoVITS/pretrained_models)会自动就位,你不用再手动搬运文件。
第 2 步:首次运行,打开界面 🖥️
安装完成后,在项目根目录执行下面这一行,浏览器会自动打开 WebUI 主页:
python webui.py第 3 步:进入推理页,先玩零样本
在主页点进 GPT-SoVITS-TTS 推理页(或单独运行 GPT_SoVITS/inference_webui.py),上传任意一段 5 秒以上的语音作为参考,输入一段文字,点合成——你的第一段克隆语音就有了。
避坑提示:不同版本(v1 / v2 / v2Pro / v3 / v4)的预训练模型必须整套配套使用,混用会出金属音或哑音;Mac 用户训练时默认走 CPU,属正常现象,官方如此设定。
新手最常问的 6 个问题,一次答清
刚上手最容易卡住的地方我都整理好了,遇到对应情况照着做即可:
Q1:合成的声音带"金属味"或发闷,怎么办?先检查模型版本是否整套配套——比如 v4 要用 v4 的模型文件放进 GPT_SoVITS/pretrained_models,别拿 v3 的 s2 模型配 v4 的声码器。确认配套后问题基本消失。
Q2:真的只用 1 分钟数据就能训吗?效果稳吗?能训,1 分钟是下限;想要更稳的音色,建议录 3~5 分钟,内容覆盖平时说话的语速和语气。录音环境越安静越好。
Q3:参考音频只有 5 秒,为什么效果不如别人晒的好?5 秒零样本本来就是"试水模式",音色抓得没那么准。喜欢这个声音的话,就用同一人的语音做 1 分钟微调,相似度会明显上一个台阶。
Q4:版本这么多,我该用哪个?简单规则:训练音频质量一般(手机录、有环境音)选 v1/v2/v2Pro 系列,成品自然度更好;音频干净、追求高保真和 48kHz 原生输出选 v3/v4。
Q5:显卡显存只有 8GB,能跑吗?能。在 WebUI 中开启半精度(is_half),并把批处理 batch size 调小即可训练;推理本身对显存要求更低。
Q6:我有一段带 BGM 的歌,想先抠出干净人声?用 WebUI 集成的 UVR5 人声分离(tools/uvr5/)先做人声/伴奏分离,得到干净人声再去训练,效果立竿见影。
它能干什么:4 项核心能力逐个拆解
这一节把 GPT-SoVITS 真正值钱的能力拆开讲,每项都按"是什么、怎么操作、能得到什么"三步走。
零样本合成:5 秒声音,当场出 demo
是什么:不训练、零等待,给一段 5 秒的参考语音,模型就能"借用"这个音色朗读你的文字,相当于给 AI 临时装了一块"音色记忆芯片"。怎么操作:打开推理 WebUI → 上传参考音频并粘贴对应文本 → 点合成,几秒到几十秒出结果。能得到什么:一段立刻能听的效果样张,用来快速判断"这个人声值不值得花时间训练"。
1 分钟微调:把随手录音变成专属模型
是什么:用 1 分钟左右的语音对预训练模型做少量微调,得到绑定这个音色的专属模型,相似度和真实感明显高于零样本。怎么操作:在 WebUI 微调流程里依次走:填音频路径 → 自动切片 → 可选降噪 → ASR 自动转写文本 → 校对文本 → 点开始训练。你只需要提供原始音频和花 1 分钟校对文字,GPT_SoVITS/prepare_datasets/ 背后的切片、特征提取都自动完成。能得到什么:一个可反复使用的专属声音模型,之后任何文字都能用它朗读。
跨语言朗读:中文训练的模型,也能读日语
是什么:训练数据和合成文本可以不是同一种语言,目前覆盖中文、英文、日文、韩文、粤语(语言代号 zh/en/ja/ko/yue)。怎么操作:推理时在文本框里直接输入目标语言的句子,或在混合文本中切换语言标注即可。能得到什么:一套模型多语种复用,给海外内容配音、做本地化素材都省了一大笔语料钱。
内置数据集厨房:从原始音频到训练数据一步到位
是什么:项目把"备料"环节全打包了——自动切片(tools/slicer2.py)、降噪、多语种 ASR 转写(tools/asr/ 支持 Fun-ASR-Nano、SenseVoice、Faster Whisper 等引擎)、人声分离。怎么操作:在微调页按提示点选即可,全程无需手动剪音频、听写文字。能得到什么:一份标注好的训练数据集,这正是决定模型像不像的关键原料。
谁适合用:3 个最典型的使用组合
这些场景的共同点是:有"需要大量说话"的内容,而真人录音成本太高。
有声内容创作(播客 / 有声书 / 短视频)你能做什么:用主播的 1 分钟语音建模型,批量朗读新稿件;不同声音样本还能分饰多角,实现"一人演全剧"。 适合谁:内容创作者、独立播客主、有声书工作室。
个性化语音助手你能做什么:让家庭设备、学习软件、无障碍导航用家人的声音或你偏爱的音色说话,交互瞬间有了温度。 适合谁:智能家居玩家、教育产品团队、无障碍应用开发者。
游戏与虚拟形象配音你能做什么:为 NPC、动画角色快速生成成百上千条台词,换个声优只需要换一份参考音频;结合 api.py 和 api_v2.py 还能把合成功能接进你自己的程序。 适合谁:独立游戏开发者、动画团队、虚拟主播项目。
现在就跑起来
录 1 分钟你的声音,装好环境,打开 WebUI——从这段文字到第一段专属声音,中间只剩三步。门槛比你想象的低得多,成果比你想的快。
行动号召:现在就去项目仓库
https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS克隆最新代码,执行git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS,装上环境,今晚就听到你的"数字分身"开口说话。
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考