Buzz 离线语音转文字完整教程:不上传音频,几分钟把录音变文稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款完全在本地运行的语音转录与翻译工具,底层由 OpenAI 的 Whisper 模型驱动。它要解决的核心问题只有一个:你不想把会议录音、课程音频、采访素材上传到任何在线服务,却仍然需要一份准确、带时间戳的文字稿。Buzz 让这一切在你的电脑上完成——全程不联网,音频文件不离开本机,同时支持近百种语言的识别,以及把外语音频直接翻译成目标语言的文字。
为什么选择 Buzz 而不是在线转录服务
在线转录服务用起来方便,但代价是隐私和依赖:文件要上传到第三方服务器,处理速度受网络影响,部分服务按音频时长收费。Buzz 的差异化优势可以归纳为三点:
- 数据不出本机。转录、翻译、编辑全部离线完成,敏感内容(合同谈判、医患沟通、内部会议)不会进入任何云端。
- 一次下载,反复使用。模型文件缓存在本地,之后处理任意数量的音频都不产生费用。
- 硬件利用充分。Buzz 支持多种 Whisper 推理后端,Nvidia GPU 可走 CUDA 加速,Mac 可利用 Apple Silicon,集显和其他 GPU 则可通过 Whisper.cpp 的 Vulkan 加速。没有独显的机器同样能用,只是速度不同。
此外,它覆盖了从导入文件到批量处理的完整链路:转录音频视频文件、从麦克风实时转录、识别说话人、导出字幕、监控文件夹自动批处理,还有命令行接口和插件系统(内置 AI 摘要、自动字幕重排等插件),细节可在 官方使用文档 中查阅。
三分钟上手:拿到 Buzz 并完成第一次转录
Buzz 支持 Windows、macOS(Intel 与 Apple Silicon)和 Linux。获取方式有两种:下载对应系统的官方安装包,或从源码克隆。克隆仓库只需要一条命令:
git clone https://gitcode.com/GitHub_Trending/buz/buzz打开主界面后,你看到的是一张任务列表——Buzz 的所有转录都以"任务"为单位,在这里排队、执行、查看进度。第一次转录的操作路径很短:
- 点击添加按钮,选择本地音频或视频文件(MP3、WAV、M4A、MP4 等常见格式均可);
- 在任务设置里确认模型和语言(默认即可先跑通);
- 开始处理,任务进度实时显示在列表中。
第一次处理前 Buzz 会自动下载所选 Whisper 模型,之后再运行就完全离线了。
影响转录效果的三个关键设置
转录质量主要取决于模型、语言、导出格式三项配置,都集中在偏好设置里。
模型大小:速度与精度的取舍。小型模型处理快,适合大批量素材或快速出草稿;大型模型识别准确率更高,适合需要精读定稿的内容。不确定时,先用小模型跑一遍,发现错漏再针对片段换大模型重跑,是常见做法。
语言设置:自动检测还是手动指定。音频语言单一且明确时,手动指定源语言更稳;内容多语言混杂时,开启自动检测,Buzz 会逐段判断。
导出格式:按用途选。支持 TXT(纯文稿)、SRT 和 VTT(带时间戳的字幕)三种格式,字幕可直接投喂给视频编辑工具。
转录之后:编辑、字幕重排与批量处理
转录结果只是起点,Buzz 的转录查看器支持对结果做二次加工:
- 文本修正:直接点击识别错误的片段改字,无需回到原始音频逐帧重听。
- 时间戳调整:逐段修改起止时间,让文字与音频精确对齐。
- 段落重排(Resizer):Whisper 输出的句子切分常常不符合阅读习惯,字幕合并、拆分工具可以把碎段合并成整句、或把长段拆短,控制每行字幕的时长。这是Buzz处理长音频字幕最实用的功能之一,相关逻辑位于 字幕重排源码。
批量场景下有两个机制值得关注:
- 队列管理:任务列表按顺序逐个执行,导入几十个文件后可以离开电脑去忙别的。
- 文件夹监控:指定一个目录后,新丢进去的音频文件自动进入转录队列,适合持续接收素材的工作流。
如果你需要在演讲、直播等场合实时出字,Buzz 还内置了麦克风实时转录和独立的全屏演示窗口;插件系统则提供了 AI 摘要、说话人区分等扩展能力,源码在 buzz/plugins/。
三类典型使用场景
- 商务会议记录:录音离线转成文字,会后整理纪要、分发给参会者,敏感内容不经过任何第三方服务器。
- 课程与播客学习:长音频转成带时间戳的文字,配合查看器的播放控制快速定位重点,也能直接导出 SRT 当字幕用。
- 内容创作:视频、播客制作者用文件夹监控批量导入素材,先小模型出粗稿、再人工修正,最后导出字幕,整个流程不依赖网络。
常见问题与排错
转录太慢怎么办?换更小的模型档位是最直接的办法;也可以在高级设置里调整温度等参数。有独显的机器确认对应的加速后端(CUDA 或 Vulkan)已启用,速度会有明显提升。
识别不准怎么改善?三个检查点:源音频尽量清晰;语言设置与说话人实际语言一致;在高级设置里填写"初始提示"(一段描述音频内容的文字),相当于给模型提供了上下文,对术语密集的音频尤其有效。
文件打不开、格式不支持?Buzz 覆盖绝大多数常见音频视频格式,个别不兼容的文件先用 ffmpeg 等工具转成 MP3 或 WAV 再导入即可。
结语
Buzz 把 Whisper 的识别能力装进了一台本地桌面应用:离线、免费、可编辑、可批量。如果你的需求是"把录音变成文字,但音频不能上传",它就是目前最省心的选择——克隆仓库、跑通第一条转录任务,大概只需要十分钟。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考