news 2026/9/8 2:57:01

OpenVoice 语音克隆入门:5分钟克隆出属于你的AI声音

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
OpenVoice 语音克隆入门:5分钟克隆出属于你的AI声音

OpenVoice 语音克隆入门:5分钟克隆出属于你的AI声音

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

OpenVoice 是 MIT 与 MyShell 联合发布的语音克隆音频基础模型,它通过分析一段短参考音频的音色,让 AI 用被克隆的声音朗读任意文本。本文按"装环境 → 跑通首次克隆 → 进阶调参"的顺序,带你走完全部流程。

获取仓库并安装依赖

本地部署面向熟悉 Linux 和 Python 的用户,纯体验可以直接跳到下一节的线上演示。

克隆 OpenVoice 仓库

用下面的命令把项目拉到本地:

git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice

安装依赖并准备模型权重

依赖清单见 requirements.txt。建议单独建一个 conda 环境,避免污染本机已有的 Python 环境:

conda create -n openvoice python=3.9 conda activate openvoice pip install -e .

权重需要另行下载并解压到checkpoints(V1)或checkpoints_v2(V2)目录,下载地址与步骤在 docs/USAGE.md 里有说明。V2 还需要额外安装 MeloTTS 组件,照着文档执行即可。

在 Workshop 中完成首次声音克隆

线上 Workshop 是上手最快的路线,不用配置任何环境,上传音频就能看到效果。

创建 Bot 准备操作环境

进入 Workshop 页面,点左下角的 Create a Bot 新建一个 Bot,它是后续挂载语音的容器。

挑选一个顺眼的 TTS 模型

打开 Widget Center,切到 TTS 标签页,按语言和输入输出类型筛选,点击任意一张 TTS 模型卡片进入。模型卡片上附带的试听文案可以先帮你判断音色偏好。

上传参考音频生成你的声音

在 Bot 设置页打开 Voice (TTS) 开关,点 Create 上传一段参考音频。系统会从中提取音色并生成可克隆的 Voice,之后这个 Bot 读出的所有文本都会用你的声音。

看懂背后的声音换色机制

知道原理后,遇到问题时更容易判断该调哪个环节。

整体思路不复杂:文本先交给基础 TTS 模型,合成出一个"别人声音"的语音;音色提取器(Tone color extractor)同时分析参考音频,得到音色特征;Encoder、Flow、Decoder 链路只替换语音的音色,内容和节奏保持不变。

自己调风格参数

口音、情绪、节奏、语调这类风格参数由基础 TTS 模型控制,而不是从参考音频里克隆出来的,因此风格可调的幅度取决于所选基础模型。用法示例见 demo_part1.ipynb。

用另一种语言说出克隆的声音

跨语言克隆对参考音频和目标语言都不做硬性限制,哪怕两者都没出现在训练集里。多语言示例在 demo_part2.ipynb,V2 的原生多语言(英、西、法、中、日、韩)用法在 demo_part3.ipynb。

适合谁用,以及边界在哪

OpenVoice 定位是技术方案而非成品应用,目标用户是开发者和研究者:多数声音上效果稳定,但不保证每段音频都完美。

几个明确的边界:

  • 只克隆音色,不克隆口音和情绪,后者由基础 TTS 模型决定。
  • 参考音频有基本门槛:无明显背景噪音、时长够、只有一个人说话、不含过长静音。
  • V1/V2 均为 MIT 许可,商用不受限制。

更多安装细节和报错排查,直接翻 docs/USAGE.md 与 docs/QA.md,常见坑基本都有现成答案。

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 7:02:02

yuzu Switch模拟器入门指南:从零到流畅运行的完整上手流程

yuzu Switch模拟器入门指南:从零到流畅运行的完整上手流程 【免费下载链接】yuzu 任天堂 Switch 模拟器 项目地址: https://gitcode.com/GitHub_Trending/yu/yuzu yuzu 是一款免费开源的任天堂 Switch 模拟器,可以在 Windows、Linux 和 Android 上…

作者头像 李华
网站建设 2026/9/6 5:22:46

大模型+FFmpeg:从零搭建一句话混剪机器人

做混剪最花时间的不是拍摄,而是从一堆素材里找镜头、定顺序、卡节奏、配 BGM。过去这套流程要在剪辑软件里手动完成,今天借助 Grok 这类大模型和 FFmpeg,可以把它压缩成手机上一句话的事。最近 Grok 剪辑 Bot 的开源项目让不少人开始尝试自建…

作者头像 李华
网站建设 2026/9/8 2:56:20

好未来秋招移动端笔试复盘:考点分布与编程题实战解析

2023年好未来秋招移动端开发岗第四批笔试,我是刚好赶上了这批。整体考下来最大的感受是:好未来的笔试不像有些大厂那样纯靠海量刷题堆出来的,题目量不算变态,但考察面很杂,从计算机基础到移动端专项再到业务场景题都有…

作者头像 李华
网站建设 2026/9/8 2:56:57

Kitty GPU终端:3步跑通,4个核心功能用熟

Kitty GPU终端:3步跑通,4个核心功能用熟 【免费下载链接】kitty If you live in the terminal, kitty is made for you! Cross-platform, fast, feature-rich, GPU based. 项目地址: https://gitcode.com/GitHub_Trending/ki/kitty Kitty 是一款跨…

作者头像 李华
网站建设 2026/9/8 2:54:37

腾讯音乐秋招移动客户端笔试复盘:题型解析与备考策略

2023年秋招,我投的是腾讯音乐的移动客户端开发岗。从8月底官网投递简历,到9月中旬收到笔试通知,再到坐在摄像头前完成那120分钟的在线笔试,整个过程下来,最大的感受是:这套题不偏不怪,但覆盖面很…

作者头像 李华