Buzz 离线语音识别工具使用指南:音频转文字、录音转字幕的完整教程
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的离线语音识别工具,运行在你自己的电脑上,可以把音频文件、视频和麦克风录音转成带时间戳的文字,并导出 TXT、SRT、VTT 等格式。录音不用上传到任何服务器,转录全程在本机完成。
如果你经常要处理这类素材:开完会留下一堆录音没人整理、采访完的磁带迟迟变不成文字稿、本地视频想要一套字幕文件——Buzz 解决的就是这些事。它把 Whisper 模型跑在你的电脑上,导入文件后点一下就开始转,转完还能在界面里逐句核对、改时间轴、导出字幕。
它能帮你做什么
按使用场景来说,主要有四类活:
- 文件批处理:一次导入多个音频或视频,排队逐个转录,还能直接粘贴 URL 导入在线视频。
- 实时录音:对着麦克风边说边出文字,适合会议、讲座、采访现场,还支持把文字实时导出成文本文件。
- 多语言转录与翻译:支持 Whisper 的全部语言;翻译成英文是模型自带能力,翻成其他语言可以接一个 AI 接口完成。
- 字幕整理:转录结果带精确时间戳,可以调字幕长度、合并分句,导出 SRT/VTT 直接投到播放器或剪辑软件里。
安装 Buzz:三种方式任选其一
Buzz 支持 Windows、macOS 和 Linux,三种装法对应不同人群:
- Mac / Windows 用户:去项目发布页下载对应系统的安装包(.dmg / .exe)。注意 Windows 安装包没有签名,安装时系统会警告,选"更多信息 → 仍要运行"即可。
- Linux 用户:从应用商店装 Flatpak 或 Snap 最省事,见下面命令。
- 想从源码装或习惯命令行的用户:直接 pip 安装。
Linux 下装 Flatpak 版:
flatpak install flathub io.github.chidiwilliams.Buzzpip 方式(各系统通用,Linux 需先装好系统依赖,清单见 官方安装文档):
pip install buzz-captions python -m buzz装完双击图标或执行python -m buzz就能打开主界面。
第一次打开软件,先改哪几项
用Ctrl + ,(Mac 是Cmd + ,)打开偏好设置,先做三件事,后面用起来就顺了:
- 导出文件夹:点 Browse 选一个固定目录,比如"桌面/Buzz导出",所有转录结果都会存到这里。
- 默认导出文件名:默认模板已包含文件名、任务类型和时间,一般不用动;嫌长可以简化。
- 下载一个模型:切到 Models 标签页,先下载一个
base或small大小的模型。模型首次使用时联网下载,之后就存在本地缓存里,之后可以完全离线用。
其他选项(字体大小、实时录音导出开关等)保持默认即可,需要时再回来调。
场景一:把音频文件批量转成文字稿
目标:把几个录音文件一次性转成文字,拿到 TXT 文本。
操作步骤:
- 点左上角的
+按钮(或按Ctrl + O),选择多个音频/视频文件,文件会进入任务列表。 - 对每个任务确认三列设置:模型(如 Faster Whisper / Whisper.cpp)、任务(Transcribe 转录 / Translate 翻译成英文)、语言。
- 语言建议手动指定,别用自动检测——选对语言,识别质量通常明显更好。
- 点
Run,状态列会从 Queued 变到 In Progress,再变 Completed,括号里就是耗时。 - 双击已完成的那一行,打开转录查看器,核对内容后点
Export导出 TXT。
最终产出:一个带完整文字内容的 .txt 文件,落在你设置的导出目录里。文件名按偏好设置里的模板生成。
转长文件时可以顺手做两个动作(在导入时展开Advanced选项):勾选Word-Level Timings得到逐字时间戳,后续能做精细字幕调整;Initial prompt里填容易拼错的专有名词,比如人名、产品名,能减少错拼。
场景二:开会录音,边说边出文字
目标:会议进行中实时把发言变成文字,散会直接带走一份文字稿。
操作步骤:
- 点主界面工具栏的麦克风图标进入实时录音。
- 选好麦克风设备和语言,点
Record开始。文字会一句句出现在右侧。 - 如果想在会中就把文字留下来,去偏好设置里勾选Enable live recording transcription export,Buzz 会边录边把文字写进一个文本文件。
- 演讲现场还可以打开Presentation window,把实时字幕投到大屏上。
最终产出:一份实时滚动、持续写入文件的会议文字稿。
两个注意点:
- 实时转录比文件转录吃性能,建议选 Whisper.cpp 实现 + 较小的模型,笔记本也能跑动。
- 想录电脑里播放的声音(而不是麦克风)需要装一个虚拟音频设备(macOS 的 BlackHole、Windows 的 VB CABLE、Linux 的 PulseAudio 路由),细节见 官方使用文档。
录音功能的实现可以看 录音模块源码,想理解它内部怎么分段转录的可以从这里入手。
场景三:把转录结果整理成可用字幕
目标:给视频配一套时长、字数都合适的 SRT 字幕。
转录完成后的查看器就是工作台:
- 核对:底部有播放器,点哪一句哪句高亮,
Ctrl + F可以全文搜索关键词快速定位。 - 改时间轴:选中某句,用
Ctrl + ←/→以 0.5 秒为步长微调起止时间,改错的时间戳不用手打数字。 - 调字幕长度:点工具栏的
Resize,设置每条字幕的最大长度和是否按标点断句,点 Merge 自动重排——原本一句太长或碎成几行的字幕会被合并成阅读舒服的长度。 - 导出:
Export菜单里选 SRT、VTT、TXT 或 JSON。
最终产出:一份时间轴准确、断句合理、可直接导入剪辑软件的字幕文件。
模型怎么选、还有哪些进阶项
模型是"速度 vs 准确率"的取舍,记住一个原则就行:先用小模型跑通流程,不满意再换大的。
- tiny / base:几秒出结果,适合快速预览和长音频;
- small / medium:日常够用,推荐作为默认;
- large-v3 系列:准确率最高,但慢、吃内存,长音频要等。
实现方式(Whisper 类型)也影响速度:没有独立显卡或 Mac 上,选Whisper.cpp;有 6GB 以上显存的 NVIDIA 显卡,选Faster Whisper会快很多。模型管理界面在偏好设置的 Models 标签页,已下载和可下载的模型都列在那里,还可以下载量化版(如 q5)省内存。
其他值得知道的进阶项:
- 快捷键:偏好设置的 Shortcuts 标签页可自定义,常用的有
Ctrl + F搜索、Ctrl + P播放/暂停、Ctrl + G跳到当前播放位置。 - 说话人分离:多人对话的音频,Buzz 支持先做说话人分离再转录,还能给每句标注说话人,见 使用文档。
- 命令行:不想开界面时,
buzz add --srt 文件.mp4这类命令可以直接跑转录,完整参数见 CLI 文档。
常见问题排查清单
按"现象 → 原因 → 处理"顺序自查:
| 现象 | 可能原因 | 处理办法 |
|---|---|---|
| 转录很慢,排队等很久 | 模型太大,或纯 CPU 运行 | 换 small/base 模型;有显卡改用 Whisper.cpp 或 Faster Whisper;关掉占资源的程序 |
| 点录音没反应,报 PaErrorCode-9999 | 系统禁止了应用访问麦克风 | 检查系统隐私设置里的麦克风权限(Windows:设置 → 隐私 → 麦克风);临时关掉杀毒软件测试 |
| 识别出来的语言不对、乱码 | 自动检测猜错了语言 | 手动指定语言,不要依赖 Detect Language |
| 专有名词、人名总是拼错 | Whisper 对生词容易错拼 | 在 Advanced → Initial prompt 里把正确的写法填进去 |
| 字幕一行太长或太碎 | 默认分句不适合你的视频 | 导入时开 Word-Level Timings,再用 Resize 的 Merge 按最大长度和标点重排 |
| Buzz 启动就崩,或转录中途崩 | 模型下载不完整或损坏;CPU 太老不支持 AVX2 | 在 Models 页删掉已下载的模型重新下载;特别老的电脑无法运行,这是硬件限制 |
| 想在完全没网的电脑上用 | 模型需要首次联网下载 | 在有网机器上下载好模型,把模型缓存目录整个拷到离线电脑的相同位置(缓存位置可在 Models 页点 Show file location 查看) |
更多问题可以先查 官方 FAQ。
适合谁、接下来做什么
Buzz 适合手里有一堆录音和视频、需要文字稿或字幕,又希望数据不出本机的用户:记者、学生、会议记录者、字幕组。
下一步建议:装好之后先用一段 1 分钟左右的录音 + base 模型走通"导入 → 转录 → 导出 TXT"全流程,再按场景二、场景三的要求往实时录音和字幕整理上走。详细文档入口:安装说明、偏好设置、CLI 用法,源码在仓库根目录的 buzz/ 下,界面、转录器、数据库分层清晰,可以按需阅读。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考