Buzz 本地语音转文字指南:离线转写音频,一键导出字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费开源的桌面语音转文字工具,它在你的电脑上本地运行 OpenAI 的 Whisper 模型,把音频、视频乃至在线视频链接转成带时间轴的文字,支持翻译并导出 TXT、SRT、VTT。读完这篇指南,你能独立完成一条完整任务流:装好 Buzz,把一段音频转写成文字,最后导出可用的 SRT 字幕。
✅ 30 秒自检:你的机器能不能跑
- 系统:Mac(Intel 与 Apple Silicon)、Windows、Linux 都支持。
- CPU 需支持 AVX2,非常老的机器会崩溃。
- 联网只发生在首次下载模型时。之后完全断网可用;给隔离机用时,把模型缓存文件夹从别的电脑拷过来即可(Linux 下位于
~/.cache/Buzz)。 - 有 Nvidia 显卡可以加速;没有也没关系,CPU 能跑。
🖥️ 挑一种装法把它装上
按你的系统选一条路:
- Windows 和 macOS:从项目发布页下载安装程序(.exe / .dmg)。Windows 是未签名程序,安装时弹出警告就选 More info → Run anyway。
- Linux(Snap):
sudo snap install buzz装完再授权密码存储服务:
sudo snap connect buzz:password-manager-serviceLinux(Flatpak):
flatpak install flathub io.github.chidiwilliams.BuzzPython 环境(需 Python 3.12,并先装好 ffmpeg):
pip install buzz-captions启动程序:
python -m buzz首次运行会提示下载所选模型,体积从几十 MB 到两百多 MB。这是一次性投入,下载完成后所有转写都在本地进行。
📂 把第一段音频丢进队列
- 在 File 菜单选 Import Media File(或按 Ctrl/Cmd + O),挑一个音频或视频文件;想转在线视频也可以直接粘贴链接。
- 选任务类型:Transcribe 或 Translate;语言建议手动指定,比自动检测稳。
- 选模型和档位,点 Run。任务列表里能看到排队、处理中、已完成的实时状态。
- 状态变成 Completed 后,双击这一行打开转录详情。
一次丢几十个文件没问题,关掉窗口任务也会在后台继续跑完。
🎚️ 给模型选对档位
模型大小是速度与准确率的调节旋钮:
| 模型 | 速度 | 准确率 | 推荐用法 |
|---|---|---|---|
| Tiny | 最快 | 一般 | 快速试听、实时转写 |
| Base | 快 | 尚可 | 日常笔记 |
| Small | 中等 | 良好 | 会议纪要初稿 |
| Medium | 较慢 | 很高 | 重要内容精转 |
| Large | 最慢 | 最高 | 字幕交付 |
我的建议直接给:粗转用 Base 就够,交付级字幕一步到位上 Large。
后端(Whisper 类型)决定用哪套引擎跑模型:
| 后端 | 选它的理由 |
|---|---|
| Whisper(OpenAI 原版) | 精确但慢、吃内存,除非需要兼容性否则不推荐 |
| Faster Whisper | 有 6GB 以上显存的 Nvidia 卡选它,快一个量级 |
| Whisper.cpp | 没有 Nvidia 卡、Mac、纯 CPU 选它,核显也能实时转写 |
| HuggingFace | 想用针对特定语言优化的社区模型时选它 |
两个容易漏的选项:
- Linux 上 Nvidia 显卡开箱即用 GPU 加速,Large 模型速度会快好几倍。
- Advanced 里的 Initial prompt 可以写人名、专业术语,能明显减少拼错。
模型的下载、删除都在这页完成;Whisper.cpp 还支持粘贴一个 .bin 文件的下载链接,用第三方定制模型。
📄 把转写结果变成能用的交付物
双击已完成的任务进入转录视图,这是一个迷你字幕编辑器:
- 每段文字带起止时间戳,点任意片段跳到对应音频位置。
- 边播放边改文本,改动自动保存;播放速度 0.5 倍到 2 倍可调,方向键加 Ctrl 能按 0.5 秒微调片段时间。
- Ctrl+F 全文搜索,逐条跳转匹配。
做字幕还要走一步 Resize:在转录视图点 Resize,设一个字幕最大长度,长句会按标点拆开;音频里若有静音分析还会帮你合并过短的碎片(前提是导入时开了 word-level timings 选项)。调好后从导出菜单选 SRT 丢进剪辑软件,TXT 当文字笔记,VTT 用于网页,各取所需。
🚀 进阶场景与常见卡点
三个现在就能用的场景:
- 麦克风实时转写:用 Whisper.cpp 加小模型点 Record,边说边出字,还能开演示窗口在会议现场投出来。
- 文件夹监控:指定监控目录,新音频一放进去自动开转,适合丢进共享文件夹的团队协作。
- 说话人识别:多人访谈自动标注说话人,可改成真实姓名,还能合并同一人的连续句子。
- 命令行批处理:
buzz add --task transcribe --model-type whispercpp --model-size small --srt /path/to/audio.mp4一条命令直接产出 SRT,跳过图形界面,写进脚本就是自动化流水线。
卡点速查:
- 转得太慢:先降一档模型,再考虑 GPU 加速,别开太多并行任务。
- 准确率差:录音先保清晰,再换 Large 重跑;手动指定语言优于自动检测。
- 崩溃:多为模型下载不完整,去 Models 设置页删掉重下。
- 任务一直排队:多半是模型还没下好,先回 Models 页确认。
最小起步动作:挑一段你手头的录音,按系统装上 Buzz,丢进队列用 Base 跑一遍,你会拿到一份能直接交付的 SRT。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考