OpenVoice 语音克隆入门:上传 10 秒录音,让 AI 开口说你的话
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
先把成品放在你面前:录一段 10 秒的自己说话,OpenVoice(MIT 与 MyShell 联合开发)就能用你的音色把任意文字念出来。语气、情感还能按需调。整个过程不需要你训练任何模型,也不需要 GPU。
下面按"录参考音 → 选底座 → 换语言"这条线,带你把第一条克隆语音做出来。
三分钟做出第一条克隆语音
全程只需要三步:
- 进 Workshop,创建一个 Bot。点"Create a Bot"即可,这是承载你语音的容器。
- 在 Widget Center 里选 TTS Widget。打开"Widget Center",切到 TTS 标签,里面有多国语言的现成音色可选。
- 点一个你喜欢的 TTS 模型,用语音克隆生成声音。参考录音上传后,系统提取音色特征,合成就完成了。
不想装环境?仓库里给了已部署好的在线体验入口(docs/USAGE.md 的 Quick Use 一节),直接点进去就能试,零成本。
背后是怎么做到的
流程图把角色分得很清,记住一个分工就够:
- 基础说话人 TTS 模型:负责"说",决定语言、口音、情感、节奏。
- 音色提取器:从你的参考录音里抠出音色(tone color)。
- 转换器:把音色"贴"到 TTS 生成的语音上,过解码器输出成品。
也就是说,OpenVoice 只克隆音色,不克隆口音和情绪——这点对后文的踩坑很关键。
参考录音怎么选才不翻车
官方 QA 里最容易被忽视的一节,直接给你翻译成检查清单:
| 检查项 | 原因 |
|---|---|
| 录音要干净,别带背景噪音 | 噪音会被当成音色一起学进去 |
| 不要多人声混在一起 | 音色提取会"打架" |
| 别太短,也别留长段空白 | 特征不足,效果直线下滑 |
| 换录音前先删掉 processed 缓存 | 同名旧缓存会让"新录音"没生效 |
还有一条容易踩:生成结果不像,先别怪模型。口音和情感由底座 TTS 决定,想换风格,是换底座,不是调参数。
换语言、换情感怎么换
- 换语言:只要换成支持目标语言的基础 TTS 模型就行,V2 版原生支持中、英、日、韩、法、西六种语言,参考录音本身用任何语言录都可以。
- 换情感、口音:换一个带这种口音/情感的底座模型,框架里替换底座即可,音色转换器不用重训。
想本地跑起来,一条命令装好:
git clone https://gitcode.com/GitHub_Trending/op/OpenVoice然后进目录执行pip install -e .,下载对应版本的 checkpoint,核心逻辑都在 openvoice/ 目录里,跑本地界面用python -m openvoice_app --share启动。Windows 和 Docker 的社区安装指南也在 docs/USAGE.md 里。
装完之后你会发现,给视频配一段自己的声音、做有声书旁白、搭一个用自己的声音说话的助手,都只是换个文本输入的事。MIT 协议下 V1/V2 均可免费商用,剩下的就是挑一句你想让"它"说的话了。
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考