OpenVoice:如何用几秒音频在3分钟克隆出你的声音
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
OpenVoice 是 MIT 与 MyShell 联合发布的即时语音克隆音频基础模型(音频基础模型:在海量音频上预训练、可复用的底层模型):上传几秒干净参考音频,即可生成此人音色说的新语音。面向缺乏训练条件的开发者与内容创作者,解决没有专业录音设备也能获得稳定个人声音的问题。
先体验效果:在线3步看到结果
不用安装任何软件,MyShell 官方已部署好在线服务,参考音频不限语言:
- 进入 MyShell 的 Workshop,点击 Create a Bot 创建一个 Bot
- 在 Bot 设置里打开 Voice (TTS,即文本转语音合成) 开关
- 在 Widget Center 的 TTS 分类挑一个基础音色,可直接试听对比
- 通过 voice cloning 上传几秒参考音频,输入文本,几秒后得到结果
原理深潜:从文本到克隆语音的5步
可以把整体思路理解为"换引擎不换驾驶风格"——基础 TTS 模型决定怎么读,音色转换模块只负责换成谁的声音。
- 文本加上风格参数(情感、口音、节奏)
- 基础 speaker TTS 模型合成目标风格语音
- 音色提取器从参考音频提取说话人音色特征
- 音色转换器替换音色,保留原有风格
- 输出:参考人的音色 + 你指定的风格
能力清单:OpenVoice 能做什么
- 精准音色克隆:几秒干净人声即可提取音色,生成几乎同音色的语音
- 音色与风格分离:只克隆音色,情感、口音、节奏由基础 TTS 单独控制,互不干扰
- 零样本跨语言克隆:参考音频与输出语言不必相同,V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言
- 免费商用:V1 与 V2 均为 MIT 协议,商业与研究用途不收费
适合哪些场景:4个常见用法
- 🎬 视频配音:适合想换解说员音色但不改原节奏的创作者,省去重新录音
- 📚 有声朗读:适合播客与自媒体,用同一音色批量产出中英文朗读
- 🌐 语言学习:适合学习者,让同一"说话人"用不同语言读同一段文本,对比发音与语调
- 📱 个性化助手:适合智能设备用户,熟悉的音色让语音回应更有"人情味"
动手之前:Linux环境要求与3个常见坑
环境要求(官方文档仅提供 Linux 方案):
- 系统:Linux,官方文档面向熟悉 Linux、Python 的用户
- 版本:Python 3.9,用 conda(Python 环境管理工具)创建
- 硬件:建议带 GPU、显存 4GB 以上
- 网络:首次运行需联网下载 silero-vad(语音活动检测组件)
最少安装命令:
conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完后可直接启动本地 Gradio(本地网页演示框架)页面体验:
python -m openvoice_app --share常见坑:
- 坑点:没下载模型权重——启动时找不到模型文件。解决:下载官方 checkpoint(模型权重文件),V1 解压到
checkpoints目录,V2 解压到checkpoints_v2目录 - 坑点:首次运行无网络——silero-vad 自动下载失败,参考音频处理报错。解决:手动获取压缩包并解压到
~/.cache/torch/hub/对应目录 - 坑点:V2 漏装依赖——不装 MeloTTS(提供基础音色的 TTS 模型),V2 示例无法运行。解决:按 docs/USAGE.md 的 V2 一节补充安装
高频问答:5个常见问题
能克隆情感和口音吗
不能。OpenVoice 只克隆参考人的音色,情感与口音由所选基础 TTS 模型决定。想换情感或口音,需要换一个对应风格的基础 speaker 模型。
生成语音不像参考人或质量差,先检查什么
依次检查参考音频是否有背景噪音、是否太短、是否含多人说话、是否有长段静音。另外参考文件名与之前重复且未清理processed缓存目录时,也会用到旧的处理结果。
支持哪些输出语言
V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言,参考音频本身可以是任意语言。只要有对应语言的基础 speaker 模型,还能扩展到其他语言。
可以商用吗
可以。V1 与 V2 均按 MIT 协议发布,商业用途与研究用途均免费。
OpenVoice 是开箱即用的产品吗
不是。官方定位是"技术而非产品",不对每种声音都保证完美效果,目标用户是开发者与研究者。 </输出文章>
(注:文末按结构要求还应含入口链接,见下。)
<输出文章>
OpenVoice:如何用几秒音频在3分钟克隆出你的声音
OpenVoice 是 MIT 与 MyShell 联合发布的即时语音克隆音频基础模型(音频基础模型:在海量音频上预训练、可复用的底层模型):上传几秒干净参考音频,即可生成此人音色说的新语音。面向缺乏训练条件的开发者与内容创作者,解决没有专业录音设备也能获得稳定个人声音的问题。
先体验效果:在线3步看到结果
不用安装任何软件,MyShell 官方已部署好在线服务,参考音频不限语言:
- 进入 MyShell 的 Workshop,点击 Create a Bot 创建一个 Bot
- 在 Bot 设置里打开 Voice (TTS,即文本转语音合成) 开关
- 在 Widget Center 的 TTS 分类挑一个基础音色,可直接试听对比
- 通过 voice cloning 上传几秒参考音频,输入文本,几秒后得到结果
原理深潜:从文本到克隆语音的5步
可以把整体思路理解为"换引擎不换驾驶风格"——基础 TTS 模型决定怎么读,音色转换模块只负责换成谁的声音。
- 文本加上风格参数(情感、口音、节奏)
- 基础 speaker TTS 模型合成目标风格语音
- 音色提取器从参考音频提取说话人音色特征
- 音色转换器替换音色,保留原有风格
- 输出:参考人的音色 + 你指定的风格
能力清单:OpenVoice 能做什么
- 精准音色克隆:几秒干净人声即可提取音色,生成几乎同音色的语音
- 音色与风格分离:只克隆音色,情感、口音、节奏由基础 TTS 单独控制,互不干扰
- 零样本跨语言克隆:参考音频与输出语言不必相同,V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言
- 免费商用:V1 与 V2 均为 MIT 协议,商业与研究用途不收费
适合哪些场景:4个常见用法
- 🎬 视频配音:适合想换解说员音色但不改原节奏的创作者,省去重新录音
- 📚 有声朗读:适合播客与自媒体,用同一音色批量产出中英文朗读
- 🌐 语言学习:适合学习者,让同一"说话人"用不同语言读同一段文本,对比发音与语调
- 📱 个性化助手:适合智能设备用户,熟悉的音色让语音回应更有"人情味"
动手之前:Linux环境要求与3个常见坑
环境要求(官方文档仅提供 Linux 方案):
- 系统:Linux,官方文档面向熟悉 Linux、Python 的用户
- 版本:Python 3.9,用 conda(Python 环境管理工具)创建
- 硬件:建议带 GPU、显存 4GB 以上
- 网络:首次运行需联网下载 silero-vad(语音活动检测组件)
最少安装命令:
conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完后可直接启动本地 Gradio(本地网页演示框架)页面体验:
python -m openvoice_app --share常见坑:
- 坑点:没下载模型权重——启动时找不到模型文件。解决:下载官方 checkpoint(模型权重文件),V1 解压到
checkpoints目录,V2 解压到checkpoints_v2目录 - 坑点:首次运行无网络——silero-vad 自动下载失败,参考音频处理报错。解决:手动获取压缩包并解压到
~/.cache/torch/hub/对应目录 - 坑点:V2 漏装依赖——不装 MeloTTS(提供基础音色的 TTS 模型),V2 示例无法运行。解决:按 docs/USAGE.md 的 V2 一节补充安装
高频问答:5个常见问题
能克隆情感和口音吗
不能。OpenVoice 只克隆参考人的音色,情感与口音由所选基础 TTS 模型决定。想换情感或口音,需要换一个对应风格的基础 speaker 模型。
生成语音不像参考人或质量差,先检查什么
依次检查参考音频是否有背景噪音、是否太短、是否含多人说话、是否有长段静音。另外参考文件名与之前重复且未清理processed缓存目录时,也会用到旧的处理结果。
支持哪些输出语言
V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言,参考音频本身可以是任意语言。只要有对应语言的基础 speaker 模型,还能扩展到其他语言。
可以商用吗
可以。V1 与 V2 均按 MIT 协议发布,商业用途与研究用途均免费。
OpenVoice 是开箱即用的产品吗
不是。官方定位是"技术而非产品",不对每种声音都保证完美效果,目标用户是开发者与研究者。
OpenVoice 最大卖点:音色克隆与风格合成解耦,几秒音频上手,MIT 协议免费商用。
- 使用文档:docs/USAGE.md
- 常见问题:docs/QA.md
- 核心源码目录:openvoice/
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考