Buzz 离线语音转文字实战:从会议录音到批量字幕,一次跑通
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
散会后你打开那份两小时的会议录音,发现还是得逐句听、逐句敲字;外语播客里想摘几句金句,只能反复暂停打字;视频剪到一半,云端字幕服务又超时了。这三件事的共同解法,其实是同一个:Buzz,一个跑在你自己电脑上的离线语音转文字工具,底层用 OpenAI 的 Whisper 模型,整段音频只在你硬盘上处理完,没有上传环节,也就没有断网、排队和按分钟计费的问题。它覆盖 99 种语言,纯 CPU 就能转,有 NVIDIA 显卡还能再快一个数量级。
装好 Buzz,顺手跑通第一条转录
三个平台,各一条命令
| 系统 | 推荐方式 | 命令 |
|---|---|---|
| Windows | winget 包管理器 | winget install ChidiWilliams.Buzz |
| macOS | Homebrew | brew install --cask buzz |
| Linux | Flatpak 或 Snap | flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz |
Windows 用户注意:安装包没有做代码签名,装的时候会弹安全警告,点"更多信息"→"仍要运行"即可,源码公开可查。不想用命令行的,也可以从项目发布页直接下对应平台的安装包。
注意:装完后在终端敲一条
buzz就能启动主界面。想试未发布的最新版,把仓库克隆下来(https://gitcode.com/GitHub_Trending/buz/buzz),按 README 装好依赖运行即可。
最小可行流程,五步出稿
- 导入文件:菜单栏"文件 → 导入媒体文件"(
Ctrl/Cmd + O),MP3、WAV、MP4、MOV 都行,解码交给它内置的音频处理。 - 选参数:Task 选 Transcribe(同语言转写)或 Translate to English(任意语言转英文);Language 知道是什么语言就手动指定——自动检测偶尔翻车,手动选准确率明显更高;Model 新手选
base就够。 - 点 Run:任务进队列,主界面显示实时进度。
- 等状态变 Completed:任务列表会记录每条任务用的模型和耗时。
- 双击任务行,进入转录查看器,第一份带时间戳的文字稿就出来了。
整理一场两小时会议录音
改稿和调时间戳,都在同一个窗口
查看器左上角的视图按钮提供三种模式:时间戳表格(逐段校对、做字幕用)、纯文本(合并去时间,直接粘进文档)、翻译视图(先执行过翻译才有内容)。听到 Whisper 把人名听错了?在表格里双击文本单元格直接改,改动自动保存。播放用Ctrl/Cmd + P,当前片段起点用Ctrl/Cmd + ←/→微调,终点用Ctrl/Cmd + Shift + ←/→,边听边改不用切窗口。
字幕断句怪?用 Resize 重组
一句长话被拦腰截断、该换行的不换行,是字幕最影响观感的问题。工具栏的"Resize"可以按标点分割、按静音间隙合并、限制单行最大长度,一键把散乱的段落重组成规整字幕行。
提示:Resize 的重组能力依赖词级时间戳,转录前记得勾上"word-level timestamps",否则这部分功能用不了。
导出成你能用的格式
"导出"菜单覆盖四个常用出口:TXT 进文档、SRT/VTT 进剪映和 Premiere、JSON 带完整元数据给程序处理、DOCX 继续排版。导出路径和文件名模板能在偏好设置里自定义,比如"输入文件名+转录时间",一次设好以后自动套用。
演讲或直播时出实时字幕
边说边出字,模型要换小的
切到 Live Recording 标签页,选麦克风、语言和模型,点红色 Record,文字开始逐行滚出来。
注意:实时转写对性能很敏感,务必用 Whisper.cpp 后端配
tiny或base小模型,大模型跟不上语速,字幕会越落越多。
投到副屏,或喂给 OBS
点"Presentation"可以单独开一个演示窗口,把实时字幕投到外接屏或直播间,当同传字幕和提词板都行。偏好设置里再打开"实时转录导出到文本文件",每生成一句就追加写盘,OBS 读这个文件就是现成的直播字幕流。
让 Buzz 听"系统声音"
想转播客或线上课程的声音,把系统输出改道给它:Windows 装 VB-CABLE,系统输出设为 CABLE Input,Buzz 里麦克风选 CABLE Output;macOS 用brew install blackhole-2ch,在"音频 MIDI 设置"里建一个多输出设备,把扬声器和 BlackHole 都勾上;Linux 打开pavucontrol,在录制标签页把目标应用的音频重定向过去。
夜里批量处理一个文件夹的音频
GUI 一个个点适合零散文件,文件一多就该让buzz add上工了——它一次可以接多个文件:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp3 会议录音.wav这条命令用 Whisper.cpp 的 small 模型转录两个文件,直接落出 SRT 和 VTT 字幕。再常用的参数:--language zh指定语言;--prompt传提示词,把人名、产品名写进去,错字肉眼可见地少;--task translate则整条流水线变成翻译。把这条命令挂到系统定时任务里,夜里跑完一个文件夹,早上起来直接收稿。
模型、参数和硬件:一张表选完
| 档位 | 适合场景 | 预期 |
|---|---|---|
tiny/base | 低配电脑、实时录音、只看大意 | 秒级出结果 |
small | 日常转录甜点区 | 速度与准确率最均衡,多数人选它 |
medium/large | 重口音、术语密集的专业录音 | 有 GPU 才建议上,CUDA 开好后 large 的耗时能从小时级压到分钟级 |
省内存就选 Whisper.cpp 的量化版,比如q_5,用一点点精度换速度和显存的大幅改善。模型都在"偏好设置 → Models"管理:左边已下载、右边待下载,勾选后点 Download,也能粘贴自定义下载地址。
NVIDIA 用户记得在偏好设置里把 CUDA 选项打开;反过来,想彻底排除显卡干扰时,设BUZZ_FORCE_CPU=true强制纯 CPU。
排错速查表
- 中文被听岔→ 自动检测误判了语言 → 手动把 Language 选成
zh。 - 实时字幕越滚越慢→ 实时模式用了大模型 → 换 Whisper.cpp 后端加
tiny/base。 - 字幕断句不自然→ 转录时没开词级时间戳,Resize 的重组用不了 → 重新转录并勾上 word-level timestamps。
- GPU 没生效→ 驱动没装好或 CUDA 没启用 → 确认偏好设置里 CUDA 可勾选;排除法可用
BUZZ_FORCE_CPU=true。 - 模型下载龟速→ 走的默认 Hugging Face 源 → 设环境变量
HF_ENDPOINT=https://hf-mirror.com换国内镜像。
把声音变成你自己的文字资产
回到开头那三个场景:两小时的会议录音、反复暂停的外语播客、等着配字幕的视频——现在都有同一条出路:本地跑 Whisper,转出来的文字可搜索、可编辑、可导出,素材从头到尾没离开过你的机器。下一步很具体:今天装好 Buzz,把手头最需要整理的那段录音拖进去,点 Run;跑完导出个 SRT,你就把"听完"变成了"拥有"。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考