OpenVoice 语音克隆入门:5分钟克隆出属于你的AI声音
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
OpenVoice 是 MIT 与 MyShell 联合发布的语音克隆音频基础模型,它通过分析一段短参考音频的音色,让 AI 用被克隆的声音朗读任意文本。本文按"装环境 → 跑通首次克隆 → 进阶调参"的顺序,带你走完全部流程。
获取仓库并安装依赖
本地部署面向熟悉 Linux 和 Python 的用户,纯体验可以直接跳到下一节的线上演示。
克隆 OpenVoice 仓库
用下面的命令把项目拉到本地:
git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice安装依赖并准备模型权重
依赖清单见 requirements.txt。建议单独建一个 conda 环境,避免污染本机已有的 Python 环境:
conda create -n openvoice python=3.9 conda activate openvoice pip install -e .权重需要另行下载并解压到checkpoints(V1)或checkpoints_v2(V2)目录,下载地址与步骤在 docs/USAGE.md 里有说明。V2 还需要额外安装 MeloTTS 组件,照着文档执行即可。
在 Workshop 中完成首次声音克隆
线上 Workshop 是上手最快的路线,不用配置任何环境,上传音频就能看到效果。
创建 Bot 准备操作环境
进入 Workshop 页面,点左下角的 Create a Bot 新建一个 Bot,它是后续挂载语音的容器。
挑选一个顺眼的 TTS 模型
打开 Widget Center,切到 TTS 标签页,按语言和输入输出类型筛选,点击任意一张 TTS 模型卡片进入。模型卡片上附带的试听文案可以先帮你判断音色偏好。
上传参考音频生成你的声音
在 Bot 设置页打开 Voice (TTS) 开关,点 Create 上传一段参考音频。系统会从中提取音色并生成可克隆的 Voice,之后这个 Bot 读出的所有文本都会用你的声音。
看懂背后的声音换色机制
知道原理后,遇到问题时更容易判断该调哪个环节。
整体思路不复杂:文本先交给基础 TTS 模型,合成出一个"别人声音"的语音;音色提取器(Tone color extractor)同时分析参考音频,得到音色特征;Encoder、Flow、Decoder 链路只替换语音的音色,内容和节奏保持不变。
自己调风格参数
口音、情绪、节奏、语调这类风格参数由基础 TTS 模型控制,而不是从参考音频里克隆出来的,因此风格可调的幅度取决于所选基础模型。用法示例见 demo_part1.ipynb。
用另一种语言说出克隆的声音
跨语言克隆对参考音频和目标语言都不做硬性限制,哪怕两者都没出现在训练集里。多语言示例在 demo_part2.ipynb,V2 的原生多语言(英、西、法、中、日、韩)用法在 demo_part3.ipynb。
适合谁用,以及边界在哪
OpenVoice 定位是技术方案而非成品应用,目标用户是开发者和研究者:多数声音上效果稳定,但不保证每段音频都完美。
几个明确的边界:
- 只克隆音色,不克隆口音和情绪,后者由基础 TTS 模型决定。
- 参考音频有基本门槛:无明显背景噪音、时长够、只有一个人说话、不含过长静音。
- V1/V2 均为 MIT 许可,商用不受限制。
更多安装细节和报错排查,直接翻 docs/USAGE.md 与 docs/QA.md,常见坑基本都有现成答案。
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考