Buzz 离线语音转写 5 分钟上手:本地录音变字幕稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款跑在你自己电脑上的离线语音转文字工具,基于 OpenAI 的 Whisper 模型,音频、视频、麦克风实时声音都能转成文字。全程不联网、不上传,文件从不出电脑,覆盖 99 种语言,纯 CPU 也能跑。
场景一句话:你刚录完一场两小时的会议,当晚就要一份带时间戳、能编辑、能导字幕的文字稿,又不想把文件传到任何网站——这就是 Buzz 该出场的地方。
5 分钟装好 Buzz 并跑出第一条转录
安装按系统挑一条路走:
| 系统 | 推荐方式 |
|---|---|
| Windows | 从项目发布页下载安装包,双击安装 |
| macOS | 从项目发布页下载 .dmg 安装 |
| Linux | flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz |
注意:Buzz 的 Windows 安装包未做代码签名,安装时弹出安全警告属正常现象,点"更多信息"→"仍要运行"即可,源码开源可查。
装完拿到第一条转录,只需四件事:用工具栏"+"或Ctrl+O导入一个 MP3 / WAV / MP4;在弹窗里选任务"Transcribe"、模型选small、语言知道就手动选;点 Run;等状态变"Completed"后双击任务行,就能看到逐段带时间戳的文字。
提示:首次使用某个模型会自动下载,small 约 462MB,建议在 Wi-Fi 下先把常用模型拉好。
到这里,最常用的 80% 已经跑通。下面按"你想完成的事"找路径。
📝 出字幕:把转录稿导出成 SRT / VTT
双击任务进入转录查看器,顶部三个按钮覆盖全部需求:
- View:时间戳表格、纯文本、翻译三种视图,
Ctrl+T/Ctrl+E/Ctrl+L一键切换 - Export:TXT、SRT、VTT,字幕文件可直接拖进剪映、Premiere
- Resize:设置字幕最大长度、按标点分割、按静音间隙合并,一键重组出规整的字幕行
注意:Resize 的精细功能依赖词级时间戳,转录前记得勾选,事后补不了。
校对交给键盘更快:双击单元格直接改,自动保存;Ctrl+P播放/暂停;Ctrl+←/→微调当前片段开始时间,Ctrl+Shift+←/→调结束时间。
⚡ 批量处理:一个文件夹丢进去,回来收稿
文件夹监控:偏好设置 → Folder Watch,指定文件夹和模型,之后新丢进去的音频自动转录,适合"晚上扔进去、早上收稿"。
命令行:buzz add一次吃多个文件,参数完全自定义:
buzz add --model-type whispercpp --model-size small --language zh --srt --vtt 会议1.mp3 访谈.wav--task translate切翻译任务;--prompt写入常见专有名词减少错字;--word-timestamps开词级时间戳;--hide-gui无界面运行,适合配系统定时任务。完整参数见 docs/docs/cli.md。
🎙️ 实时录音:边说边出字
主界面切到 Live Recording 标签,选好麦克风、语言、模型,点红色 Record,文字随语音逐行生成。
提示:实时转写非常吃性能,务必用Whisper.cpp 后端 + tiny 或 base 模型,否则文字追不上语速。
还能打开演示窗口(Presentation Window),把实时字幕投到第二块屏幕,做演讲同传、直播看稿都很顺手。偏好设置里把录音模式从"Append below"切为"Append and correct",模型会回头修正刚生成的句子,代价是更耗硬件。
🌐 翻译:离线翻英文,任意语言接本地模型
两条路:
- Translate to English:任务直接选"翻译成英文",任意语言音频出英文稿,Whisper 自带,完全离线
- 任意目标语言:在偏好设置填入 OpenAI 兼容 API 的地址和密钥(本地 Ollama 这类兼容服务也能接),再在查看器点"Translate",写一句"只翻译、不加注释"的指令,就是全离线翻译管线
导出路径和默认文件名模板(如"输入文件名+转录时间"自动命名)也在这里设置,一次配好长期生效。
模型大小怎么选:速度精度的平衡点
| 模型 | 大小 | 什么时候选 |
|---|---|---|
| tiny / base | ~73 / 139 MB | 低配电脑、实时录音、只看大意 |
| small(默认推荐) | ~462 MB | 日常转录甜点区,速度精度平衡最好 |
| medium | ~1.5 GB | 术语密集、口音偏重 |
| large-v3 / turbo | ~2.9 / 1.6 GB | 追求极限精度,建议配 GPU |
模型管理在"偏好设置 → Models":已下载的在左、待下载在右,勾选点 Download 即可,还能粘贴自定义模型的下载地址。
五种后端怎么选:一张表定案
| 引擎 | 特点 | 适用场景 |
|---|---|---|
| Whisper.cpp | 纯 CPU 快,量化版省内存,支持 Apple Silicon 与 Vulkan | 实时录音、低配机器、无独显的 Mac |
| Whisper(PyTorch) | NVIDIA CUDA 加速最强 | 有 N 卡,跑大模型 |
| faster-whisper | 速度与精度均衡 | 无显卡机器跑大文件 |
| Hugging Face | 可跑各类 Transformer 模型 | 想尝鲜其他模型族 |
拿不准就Whisper.cpp + small;有 N 卡开 CUDA,上 large-v3-turbo,大文件转录能从"小时级"压到"分钟级"。
离线转写常见卡点速查
中文转成英文或大量错字→ 原因:自动语言检测误判 → 解法:别依赖"自动检测",导入时手动选zh。
实时转写跟不上语速→ 原因:模型太大 → 解法:换 Whisper.cpp + tiny/base,别在实时场景用 medium 以上。
模型下载极慢(国内网络)→ 原因:Hugging Face 官方源慢 → 解法:设置环境变量HF_ENDPOINT=https://hf-mirror.com后重启程序。
GPU 没生效或程序崩溃→ 原因:显卡驱动/CUDA 没配好 → 解法:先更新显卡驱动;急用可设BUZZ_FORCE_CPU=true强制纯 CPU。
字幕断句怪异又没法重组→ 原因:转录时没开词级时间戳 → 解法:重新转录并勾选word timestamps,Resize 功能即可用。
现在就可以做的一件事
打开 Buzz,导入你最需要整理的那段录音,选small模型,点 Run——5 分钟后收获第一份离线转写稿。文件夹监控、AI 摘要、DOCX 导出等更多能力,见 docs/docs/ 文档与 plugins/ 插件源码。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考