Buzz 离线语音转文字完整指南:10 分钟把声音文件变成能用的文稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
想象你在做田野调查,一天访谈下来,电脑里堆满了录音文件。没有网,没有云端服务可传,文字稿却要当晚交出来。Buzz 离线语音转文字就是为这种时刻准备的:它把 OpenAI 的 Whisper 语音识别模型跑在你自己的电脑上,把音频、视频变成可搜索、可编辑、可导出的文字。不上传、不联网、不限时长,纯 CPU 就能跑,有显卡还能再快一截。
能力速览:一张表看懂 Buzz 能干什么
在动手之前,先给你一张地图。Buzz 本质上是一个转录引擎,给了你图形界面和命令行两个入口:界面负责"单个文件、实时录音",命令行负责"批量任务"。
| 能力 | 能做什么 | 适合谁 |
|---|---|---|
| 文件转录 | 导入音频/视频(MP3、WAV、MP4、MOV…),本地转成文字 | 所有人,起步功能 |
| 实时录音转录 | 说话的同时生成文字,可开演示窗口投屏 | 会议、演讲、直播字幕 |
| 翻译 | 一键转成英文,或经 AI 翻译成任意语言 | 外语内容整理者 |
| 批量与自动化 | 命令行批量加任务、文件夹监控自动转录 | 有几十上百个文件的人 |
| 转录加工 | 双击改错、调时间戳、Resize 重组字幕行、导出 TXT/SRT/VTT/JSON | 做字幕、做文档的人 |
| 说话人识别 | 区分录音里"谁说了什么",可改名、可合并 | 访谈、会议记录 |
| 插件系统 | AI 摘要、降噪、导出 Word 等可扩展能力 | 想定制流程的人 |
语言覆盖上,Whisper 模型自带约 99 种语言,中英文到拉脱维亚语都有。下面走一遍最短路径。
最短路径:第一次转出文字,只需 4 步
第 1 步:装好它。每个平台都有一条命令:
| 系统 | 一条命令 |
|---|---|
| Windows | winget install ChidiWilliams.Buzz |
| macOS | brew install --cask buzz |
| Linux | flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz |
注意:Windows 安装包未做代码签名,安装时会弹安全警告。点"更多信息 → 仍要运行"即可,这是正常现象。
如果你是开发者想跑源码,克隆仓库
https://gitcode.com/GitHub_Trending/buz/buzz后按 README 装依赖即可。
第 2 步:导入文件,只关心三个参数。菜单"文件 → 导入媒体文件"(Ctrl/Cmd + O)或工具栏"+"图标。弹窗里三个关键下拉框:
| 参数 | 怎么选 |
|---|---|
| Task | "Transcribe"转成同语言文字;"Translate to English"直接翻成英文 |
| Language | 知道什么语言就手动选,自动检测偶尔翻车,手动指定准确率更高 |
| Model | 新手无脑选small,后面"长录音转太慢"一节细讲 |
第 3 步:点 Run。任务进队列,主界面显示实时进度。文件越大、模型越大越久,正常。
第 4 步:状态变 Completed 后,双击任务行。进入转录查看器:逐段带时间戳的文字,可以直接搜索、播放、改错,工具栏点"导出"就能拿到 TXT、SRT、VTT、JSON。第一份文字稿到手。
到这里你掌握了 Buzz 的 80%。剩下 20% 按你的实际问题对号入座。
长录音转得太慢,等不起?
转录质量的分水岭在模型,速度也是。Whisper 模型从小到大是tiny→base→small→medium→large,每升一档更准,也更慢更吃内存:
| 你的情况 | 推荐 |
|---|---|
| 低配电脑、看大意、实时录音 | tiny/base,秒级出结果 |
| 日常转录(多数人) | small,速度和准确率的甜点区 |
| 口音重、术语多的专业录音 | medium/large,建议有显卡 |
| 内存吃紧想跑大模型 | Whisper.cpp 的量化版如q_5,微小精度损失换速度 |
后端(whisper type)也有讲究:没有 N 卡或 Mac 用户选 Whisper.cpp,C++ 实现,纯 CPU 也能跑实时转录;N 卡显存 ≥ 6GB 选 Faster Whisper,比原版快一个量级;还想试多语种定制模型(Meta MMS 等),用 HuggingFace 后端。
模型在"偏好设置(Ctrl/Cmd + ,)→ Models"页管理:左边已下载,右边待下载,勾选点 Download 即可,还能粘贴自定义模型的.bin下载地址,提前把常用模型拉好。
两个加速细节:N 卡用户在偏好里确认 CUDA 选项已启用,large的转录时间能从小时级降到分钟级;如果显卡老、反而拖后腿,设环境变量BUZZ_FORCE_CPU=true强制纯 CPU。国内下载模型慢,就设HF_ENDPOINT=https://hf-mirror.com走镜像。
开会、演讲要现场出字?
主界面切到 Live Recording 标签页,选麦克风、语言、模型,点红色 Record,说话的同时文字一行行出来。
注意:实时转录吃性能,官方明确建议用Whisper.cpp 后端 +
tiny或base小模型,默认 Whisper 模型跟不上语速。
三个让现场更好用的开关:
- Append and correct 模式(偏好设置里的录制模式):会回头修正前面刚生成的句子,更准但更吃硬件;
- 演示窗口(Presentation Window):录音开始后出现新选项,把实时字幕投到外接屏,做演讲字幕、直播辅助很顺手;
- 实时转录导出到文本文件:打开后文字边生成边写入
.txt,直接接 OBS 做直播字幕。
想转的不是话筒而是电脑里放出来的声音(网课、会议软件)?装一个虚拟声卡把系统输出改道:Windows 用 VB-CABLE,把系统输出设成 "CABLE Input",Buzz 里麦克风选 "CABLE Output";macOS 用 BlackHole 建多输出设备;Linux 用pavucontrol重定向。官方文档 docs/docs/usage/2_live_recording.md 有逐步图解。
外语音频,要的是"我能懂的语言"
翻译有两条路,一条离线、一条任意语言:
- Translate to English:任务类型直接选它,任何语言的音频离线转出英文稿,这是 Whisper 自带能力,零配置;
- 任意目标语言:偏好设置里填一个 OpenAI 兼容的 API 地址和密钥,在转录查看器点"Translate",给 AI 一句指令(例如"你是专业译者,把英文翻成西班牙语,只翻译、不加注释")。本地跑 Ollama、LM Studio 的兼容模型也能接上,等于搭一条全离线翻译管线。
提示:约 1 小时音频用云端模型翻译成本在 1 美元量级;想完全免费,把翻译模型也跑在本地。
字幕断句不自然,一行长到离谱?
这是转录后最常见的返工。解法是两件事配合:
- 转录时就勾选"Word-Level Timings(词级时间戳)"——事后无法补,这一步决定后面能不能用 Resize;
- 查看器工具栏点Resize:设字幕最大长度、按标点分割、按静音间隙合并,一键把碎词重组成规整的字幕行。
顺手记下几个快捷键,校对效率翻倍:Ctrl/Cmd + P播放/暂停,Ctrl/Cmd + ←/→微调当前段开始时间,Ctrl/Cmd + Shift + ←/→调整结束时间。双击文本单元格直接改字,改完自动保存。
一个文件夹几十个音频,不想一个个点?
图形界面之外还有命令行入口。buzz add一次丢多个文件,参数按需求加:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈1.mp3 访谈2.wav这条命令用 Whisper.cpp 的 small 模型转录两个文件,并直接输出 SRT 和 VTT 字幕。常用参数:--language zh指定语言,--prompt "专有名词提示"减少错字,--task translate做翻译。配合系统定时任务,夜里跑一个文件夹,早上起来直接收稿;详细参数见 docs/docs/cli.md。
再往上还有两层自动化:文件夹监控(偏好设置里开一个目录,新文件落进去自动转录);Skip Already Transcribed 插件(重导文件夹时跳过已转过的,不重复烧算力)。
另外,访谈录音里分不清谁说的谁?查看器里点"Identify speakers",Buzz 会把不同说话人的句子标上标签,你能试听 10 秒原声、把标签改成真人姓名,保存时还能勾选把同一人的连续句子合并成段。
只记一张表:你的情况怎么选
| 如果你是… | 就这样配 |
|---|---|
| 老笔记本 / 没有显卡 | Whisper.cpp 后端 +small,量化版q_5再省内存 |
| N 卡且显存 ≥ 6GB | Faster Whisper +medium/large,开 CUDA |
| 要实时录音出字 | Whisper.cpp +tiny/base,别用默认后端 |
| 要中文以外语言的翻译 | 本地 Ollama / LM Studio 接上,全离线 |
| 文件多、要重复跑 | 命令行buzz add+ 文件夹监控 + 跳过已转插件 |
| 涉密、完全不能联网 | 在别的机器下好模型,拷到本机模型目录,离线可用 |
回到开头:现在就把那段录音变成稿子
回到开头那个山村访谈的场景——其实不需要走到山里,你手头现在就有一段"转不动"的录音:客户电话、外语课、采访现场。打开 Buzz,导入它,手动选好语言,模型选small,点 Run。等状态变成 Completed,双击,导出。你拥有的不再是一段再也听不全的录音,而是能搜索、能编辑、能导出的文字资产。
觉得顺手,去项目仓库点个 Star,遇到的问题和想法也欢迎反馈给社区。Buzz 的文件夹监控、更多语言模型、AI 摘要等能力还在持续迭代,这套本地转录工作流,值得成为你工具箱里的常驻成员。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考