Buzz:从录音到逐字稿的 5 分钟离线语音识别
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
周五下午四点,一场 40 分钟的跨部门会议刚散场,你要在今晚复盘前拿到逐字稿。把录音拖进 Buzz,几分钟后一份带时间戳的文本就躺在桌面,整个过程音频文件没有离开过这台电脑。这就是 Buzz 主打的离线语音识别:模型和音频都在本地,没有上传环节。
一分钟搞清楚 Buzz 是什么
Buzz 是一个桌面应用,内核是 OpenAI 开源的 Whisper 模型(把声音转成文字的大模型)加若干本地推理后端,把它理解成 Whisper 的桌面客户端就对了。它装在 Windows、macOS 或 Linux 上,转录和翻译都跑在你自己的机器里,只有第一次下载模型权重需要联网。适合不想把会议、访谈、课程录音交给第三方服务的个人和团队。跑起来之后你会发现,它更像一台本地录音转写工作台:批量排队、说话人标注、字幕导出都是流程的一部分。
从下载到出第一条逐字稿
- Windows:从官方渠道下载安装包,安装向导会提示应用未签名,点“更多信息”→“仍要运行”即可装完。
- macOS:下载 .dmg,把应用拖进应用程序文件夹,Apple Silicon 芯片原生加速。
- Linux:终端执行
flatpak install flathub io.github.chidiwilliams.Buzz(Flatpak 是把应用装在独立沙箱里的 Linux 打包格式);或执行sudo snap install buzz安装 Snap 包。 - 开发者版:需要 Python 3.12 并预装好 ffmpeg,然后:
pip install buzz-captions python -m buzz第一次转录:点工具栏“+”号(或 Ctrl/Cmd+O)选中一段录音,任务保持默认的 transcribe,点 Run。状态列显示 Completed 后,双击那一行打开转录页。
音频怎么进来,逐字稿怎么出去
输入有三种入口:
- 文件:MP3/WAV/FLAC/M4A/OGG 音频、MP4/MKV 等视频(自动抽音频),用拖拽或 Ctrl/Cmd+O 触发;
- 链接:把 YouTube 地址当任务粘贴进去,Buzz 先下载再转录;
- 实时:点麦克风按钮从麦克风实时转写,还能开演示窗口投到大屏上。
中间能做的事:
- 批量排队:一次加入多个文件,每行可以指定不同模型,任务表逐行显示进度;
- 语音分离:嘈杂的音频可勾选“Extract speech”,先把人声抽成干净音轨再转;
- 说话人识别:在转录页点“Identify speakers”,每位说话人自动打标,可试听 10 秒样本并把标签改成真名。
产出有三种格式:TXT、SRT、VTT,文件名支持模板变量(原文件名、任务、日期等);字幕长短可在转录页用 Resize(字幕长度调整)合并过近的片段或按标点切分;外语材料选 translate 任务,输出直接是译文。
三个可照抄的录音处理工作流
工作流一:会议纪要
- 目标:会前拿到可分发的纪要底稿。
- 关键配置:导入录音 → 手动指定语言(自动检测偶尔会判错)→ 在“高级”里把容易拼错的人名、术语写进 Initial prompt → 点 Run。
- 你拿到的产出:带时间戳的逐字稿,改完导出 TXT。
工作流二:访谈整理
- 目标:一两个小时访谈出按人分组的文字稿。
- 关键配置:导入文件 → 转录视图点“Identify speakers” → 把每个标签改成“采访人/受访者” → 勾选“Merge speaker sentences”保存。
- 你拿到的产出:按说话人归段的文字稿,导出 TXT。
工作流三:视频字幕
- 目标:拿到一套能直接导入剪辑软件的字幕。
- 关键配置:导入视频(自动抽音频)→ Export As 选 SRT → 字幕行过长就用 Resize 按间隙合并 → 导出。
- 你拿到的产出:.srt 文件。
什么时候需要动模型和参数
默认设置(transcribe 任务 + 较小的模型)对付日常听写已经够用,下面这些情况才需要动手:
| 模型大小 | 开销 | 转录速度 | 什么时候选它 |
|---|---|---|---|
| tiny | 最小,低内存机器可跑 | 最快 | 首次试用、快速校对 |
| base | 略大 | 快 | 日常会议录音 |
| small | 中等 | 中 | 准确率要求开始抬头的场景 |
| medium | 明显偏大,建议有显卡 | 较慢 | 重要访谈与讲座 |
| large | 最大,显存要求高 | 最慢 | 把准确率放在第一位的场合 |
- 加速:NVIDIA 显卡可启用 CUDA 后端,Mac 走 Apple Silicon 原生加速,普通独显还有 Vulkan 选项。
- 命名与自动化:在偏好设置里配默认导出文件名模板(支持
{{ input_file_name }}等变量);开启 Folder Watch(文件夹监视)指定一个目录,新录音自动转录导出,适合接 OBS 的录像输出目录。 - 插件:菜单里打开 Plugins 面板,AI 摘要、DOCX 导出、跳过已转录文件等内置插件按需勾选即可。
五个值得先看的目录
- buzz/transcriber/ — 各个转录后端:本地 Whisper、whisper.cpp、Hugging Face 模型、OpenAI API。
- buzz/widgets/main_window.py — 主窗口:任务表与工具栏。
- buzz/widgets/transcription_viewer/ — 转录视图页:编辑、播放、说话人识别、字幕调整。
- buzz/widgets/preferences_dialog/ — 全部偏好设置页。
- buzz/plugins/ — 插件系统与内置插件。
离线语音识别的边界与已知限制
- 常见误解:“离线”不等于“永不联网”。首次使用某个模型要联网下载权重文件,YouTube 链接任务也要联网拉视频。
- 性能边界:速度与模型大小成反比,laptop 用 large 转一小时录音可能要好几个小时;没显卡的机器建议小文件或分批夜间跑。
- 已知不足:Intel 版 Mac 上说话人识别不可用;超长文件先分段再转更稳,单个任务长期占着队列,进度不好把控。
把离线语音识别接进你的工作流
挑一条最近的会议录音,用默认设置跑一遍,导出 SRT 看看字幕长短是否够用。想再省事一点,就把 Folder Watch 指向 OBS 的录像输出目录,第二天早上导出文件夹里已经躺着当天的稿子。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考