news 2026/9/9 23:10:07

OpenVoice:如何用几秒音频在3分钟克隆出你的声音

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
OpenVoice:如何用几秒音频在3分钟克隆出你的声音

OpenVoice:如何用几秒音频在3分钟克隆出你的声音

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

OpenVoice 是 MIT 与 MyShell 联合发布的即时语音克隆音频基础模型(音频基础模型:在海量音频上预训练、可复用的底层模型):上传几秒干净参考音频,即可生成此人音色说的新语音。面向缺乏训练条件的开发者与内容创作者,解决没有专业录音设备也能获得稳定个人声音的问题。

先体验效果:在线3步看到结果

不用安装任何软件,MyShell 官方已部署好在线服务,参考音频不限语言:

  1. 进入 MyShell 的 Workshop,点击 Create a Bot 创建一个 Bot
  2. 在 Bot 设置里打开 Voice (TTS,即文本转语音合成) 开关
  3. 在 Widget Center 的 TTS 分类挑一个基础音色,可直接试听对比
  4. 通过 voice cloning 上传几秒参考音频,输入文本,几秒后得到结果

原理深潜:从文本到克隆语音的5步

可以把整体思路理解为"换引擎不换驾驶风格"——基础 TTS 模型决定怎么读,音色转换模块只负责换成谁的声音。

  1. 文本加上风格参数(情感、口音、节奏)
  2. 基础 speaker TTS 模型合成目标风格语音
  3. 音色提取器从参考音频提取说话人音色特征
  4. 音色转换器替换音色,保留原有风格
  5. 输出:参考人的音色 + 你指定的风格

能力清单:OpenVoice 能做什么

  • 精准音色克隆:几秒干净人声即可提取音色,生成几乎同音色的语音
  • 音色与风格分离:只克隆音色,情感、口音、节奏由基础 TTS 单独控制,互不干扰
  • 零样本跨语言克隆:参考音频与输出语言不必相同,V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言
  • 免费商用:V1 与 V2 均为 MIT 协议,商业与研究用途不收费

适合哪些场景:4个常见用法

  • 🎬 视频配音:适合想换解说员音色但不改原节奏的创作者,省去重新录音
  • 📚 有声朗读:适合播客与自媒体,用同一音色批量产出中英文朗读
  • 🌐 语言学习:适合学习者,让同一"说话人"用不同语言读同一段文本,对比发音与语调
  • 📱 个性化助手:适合智能设备用户,熟悉的音色让语音回应更有"人情味"

动手之前:Linux环境要求与3个常见坑

环境要求(官方文档仅提供 Linux 方案):

  • 系统:Linux,官方文档面向熟悉 Linux、Python 的用户
  • 版本:Python 3.9,用 conda(Python 环境管理工具)创建
  • 硬件:建议带 GPU、显存 4GB 以上
  • 网络:首次运行需联网下载 silero-vad(语音活动检测组件)

最少安装命令:

conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .

装完后可直接启动本地 Gradio(本地网页演示框架)页面体验:

python -m openvoice_app --share

常见坑:

  • 坑点:没下载模型权重——启动时找不到模型文件。解决:下载官方 checkpoint(模型权重文件),V1 解压到checkpoints目录,V2 解压到checkpoints_v2目录
  • 坑点:首次运行无网络——silero-vad 自动下载失败,参考音频处理报错。解决:手动获取压缩包并解压到~/.cache/torch/hub/对应目录
  • 坑点:V2 漏装依赖——不装 MeloTTS(提供基础音色的 TTS 模型),V2 示例无法运行。解决:按 docs/USAGE.md 的 V2 一节补充安装

高频问答:5个常见问题

能克隆情感和口音吗

不能。OpenVoice 只克隆参考人的音色,情感与口音由所选基础 TTS 模型决定。想换情感或口音,需要换一个对应风格的基础 speaker 模型。

生成语音不像参考人或质量差,先检查什么

依次检查参考音频是否有背景噪音、是否太短、是否含多人说话、是否有长段静音。另外参考文件名与之前重复且未清理processed缓存目录时,也会用到旧的处理结果。

支持哪些输出语言

V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言,参考音频本身可以是任意语言。只要有对应语言的基础 speaker 模型,还能扩展到其他语言。

可以商用吗

可以。V1 与 V2 均按 MIT 协议发布,商业用途与研究用途均免费。

OpenVoice 是开箱即用的产品吗

不是。官方定位是"技术而非产品",不对每种声音都保证完美效果,目标用户是开发者与研究者。 </输出文章>

(注:文末按结构要求还应含入口链接,见下。)

<输出文章>

OpenVoice:如何用几秒音频在3分钟克隆出你的声音

OpenVoice 是 MIT 与 MyShell 联合发布的即时语音克隆音频基础模型(音频基础模型:在海量音频上预训练、可复用的底层模型):上传几秒干净参考音频,即可生成此人音色说的新语音。面向缺乏训练条件的开发者与内容创作者,解决没有专业录音设备也能获得稳定个人声音的问题。

先体验效果:在线3步看到结果

不用安装任何软件,MyShell 官方已部署好在线服务,参考音频不限语言:

  1. 进入 MyShell 的 Workshop,点击 Create a Bot 创建一个 Bot
  2. 在 Bot 设置里打开 Voice (TTS,即文本转语音合成) 开关
  3. 在 Widget Center 的 TTS 分类挑一个基础音色,可直接试听对比
  4. 通过 voice cloning 上传几秒参考音频,输入文本,几秒后得到结果

原理深潜:从文本到克隆语音的5步

可以把整体思路理解为"换引擎不换驾驶风格"——基础 TTS 模型决定怎么读,音色转换模块只负责换成谁的声音。

  1. 文本加上风格参数(情感、口音、节奏)
  2. 基础 speaker TTS 模型合成目标风格语音
  3. 音色提取器从参考音频提取说话人音色特征
  4. 音色转换器替换音色,保留原有风格
  5. 输出:参考人的音色 + 你指定的风格

能力清单:OpenVoice 能做什么

  • 精准音色克隆:几秒干净人声即可提取音色,生成几乎同音色的语音
  • 音色与风格分离:只克隆音色,情感、口音、节奏由基础 TTS 单独控制,互不干扰
  • 零样本跨语言克隆:参考音频与输出语言不必相同,V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言
  • 免费商用:V1 与 V2 均为 MIT 协议,商业与研究用途不收费

适合哪些场景:4个常见用法

  • 🎬 视频配音:适合想换解说员音色但不改原节奏的创作者,省去重新录音
  • 📚 有声朗读:适合播客与自媒体,用同一音色批量产出中英文朗读
  • 🌐 语言学习:适合学习者,让同一"说话人"用不同语言读同一段文本,对比发音与语调
  • 📱 个性化助手:适合智能设备用户,熟悉的音色让语音回应更有"人情味"

动手之前:Linux环境要求与3个常见坑

环境要求(官方文档仅提供 Linux 方案):

  • 系统:Linux,官方文档面向熟悉 Linux、Python 的用户
  • 版本:Python 3.9,用 conda(Python 环境管理工具)创建
  • 硬件:建议带 GPU、显存 4GB 以上
  • 网络:首次运行需联网下载 silero-vad(语音活动检测组件)

最少安装命令:

conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .

装完后可直接启动本地 Gradio(本地网页演示框架)页面体验:

python -m openvoice_app --share

常见坑:

  • 坑点:没下载模型权重——启动时找不到模型文件。解决:下载官方 checkpoint(模型权重文件),V1 解压到checkpoints目录,V2 解压到checkpoints_v2目录
  • 坑点:首次运行无网络——silero-vad 自动下载失败,参考音频处理报错。解决:手动获取压缩包并解压到~/.cache/torch/hub/对应目录
  • 坑点:V2 漏装依赖——不装 MeloTTS(提供基础音色的 TTS 模型),V2 示例无法运行。解决:按 docs/USAGE.md 的 V2 一节补充安装

高频问答:5个常见问题

能克隆情感和口音吗

不能。OpenVoice 只克隆参考人的音色,情感与口音由所选基础 TTS 模型决定。想换情感或口音,需要换一个对应风格的基础 speaker 模型。

生成语音不像参考人或质量差,先检查什么

依次检查参考音频是否有背景噪音、是否太短、是否含多人说话、是否有长段静音。另外参考文件名与之前重复且未清理processed缓存目录时,也会用到旧的处理结果。

支持哪些输出语言

V2 原生支持英语、西班牙语、法语、中文、日语、韩语六种语言,参考音频本身可以是任意语言。只要有对应语言的基础 speaker 模型,还能扩展到其他语言。

可以商用吗

可以。V1 与 V2 均按 MIT 协议发布,商业用途与研究用途均免费。

OpenVoice 是开箱即用的产品吗

不是。官方定位是"技术而非产品",不对每种声音都保证完美效果,目标用户是开发者与研究者。

OpenVoice 最大卖点:音色克隆与风格合成解耦,几秒音频上手,MIT 协议免费商用。

  • 使用文档:docs/USAGE.md
  • 常见问题:docs/QA.md
  • 核心源码目录:openvoice/

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/9 23:08:29

AI如何批量生成电商详情页?GPT image+无限画布+Gemini实战

别急着让 AI 画图&#xff0c;先想清楚电商详情页的真正瓶颈做电商的人都有一个共同的痛点&#xff1a;详情页是转化率的命门&#xff0c;但它的生产成本高得离谱。一套优质详情页&#xff0c;通常需要设计师反复改稿、运营堆文案、再找人拍摄或买素材图。从需求确认到最终上线…

作者头像 李华
网站建设 2026/9/9 23:08:25

以VS Code为主线,打造高效可迁移的编辑器工作流

在实际开发中&#xff0c;决定效率的往往不是某个框架&#xff0c;而是每天打开时间最长的编辑器。Popular editing 并不是某一个特定软件的名字&#xff0c;而是指那些使用者多、社区活跃、教程丰富、插件生态完整、能够长期沉淀为个人工作流的编辑方案集合。很多新手容易陷入…

作者头像 李华
网站建设 2026/9/9 23:06:04

Windows事件查看器从入门到实战:掌握事件ID与日志分析定位系统故障

Windows 事件查看器这个工具&#xff0c;系统管理员天天见&#xff0c;但真正把它用明白的人不多。我见过不少同事&#xff0c;电脑一蓝屏就把整个 Minidump 拷来拷去&#xff0c;折腾半天才想起来看事件日志&#xff0c;结果两分钟就定位到几个关键事件 ID 了。今天就把我日常…

作者头像 李华
网站建设 2026/9/9 23:05:11

Si5324配置程序详解:I2C寄存器、时钟锁定与调试实践

简介&#xff1a;面向正在用STM32F407控制Si5324的硬件工程师与嵌入式开发者&#xff0c;提供完整的C语言配置方案&#xff0c;解决高精度多路时钟生成中的寄存器操作与初始化难题。压缩包共6个文件、9.49MB&#xff0c;包含可移植的Si5324.c/.h驱动源码、官方数据手册与参考手…

作者头像 李华
网站建设 2026/9/9 23:04:02

Redis为什么不用C字符串?深入解析SDS设计与性能优化

面试的时候如果被问到 Redis&#xff0c;十个有九个会撞上同一个问题&#xff1a;为什么 Redis 不用 C 语言自带的字符串&#xff0c;非要自己搞一个 SDS&#xff1f;我这几年读 Redis 源码、排查线上大 key 和缓冲问题&#xff0c;越看越觉得这题不只是一个数据结构细节&#…

作者头像 李华
网站建设 2026/9/9 23:03:44

长沙AI新媒体培训哪家好,五大维度评估内容创作培养实力

正文摘要本文从课程实用性、项目实操、师资背景、作品产出、就业对接五个维度&#xff0c;拆解长沙 AI 内容创作培训的培养质量差异&#xff0c;结合本地产业需求与机构办学信息&#xff0c;为大学生、内容创作者筛选机构提供客观参考依据。信息来源&#xff1a;长沙市人社局公…

作者头像 李华