Buzz|离线转录与语音转文字——3 分钟从音频到字幕,数据零上传
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
2 小时会议录音还躺在手机里,Buzz 在本地帮你转成文字
开完 2 小时会,录音还在手机里躺着,谁也不想再手动敲一遍。Buzz 是一个离线转录和语音转文字工具:音频、视频文件直接在你的电脑上处理,由 Whisper(OpenAI 的语音识别模型)把声音变成文字。全程不上传,隐私敏感的会议录音也能放心丢进去。
从音频到字幕文件,Buzz 能做什么
批量文件转录:视频直接当音频用
音频、视频都能导入,视频会自动提取音轨处理。一次拖入多个文件,每个文件生成独立任务排队执行,主界面一眼看到谁在跑、谁完成。
实时录音转录:边说边出文字
接上麦克风选"实时录音"模式,Buzz 默认按 20 秒一段做转录,窗口里实时滚出文字。讲座、访谈、晨会结束就能拿走文字稿,不用事后听录音。
4 种 Whisper 后端:按你的硬件挑
- Whisper 原版:最稳的基础实现
- Whisper.cpp:轻量 C++ 实现,支持 Vulkan GPU 加速
- Faster Whisper:针对转录速度优化
- Hugging Face 模型:社区上传的各种优化模型
模型从 Tiny 到 Large-v3 都有,小设备跑小模型,好显卡跑大模型。
内置翻译与说话人分离
转录完可一键翻译成其他语言,适合跨国会议和外语材料。开启说话人识别后,多人对话会按发言人分段,会议纪要不用再猜哪句是谁说的。
时间戳编辑,导出 3 种字幕格式
TXT、SRT、VTT 三种格式直接导出,SRT 和 VTT 可导入视频剪辑软件。每段文字都能改开始/结束时间、拆分或合并段落,安静环境下准确率可达 95%+,人工校对量很少。
三步跑通:安装命令与导出第一份 SRT
第一步,准备:一条命令装好
- Windows:下载安装包,安全警告选"更多信息"→"仍要运行"
- macOS:
brew install --cask buzz - Linux:
flatpak install flathub io.github.chidiwilliams.Buzz - 开发者:
pip install buzz-captions,再运行python -m buzz(需 Python 3.12)
第二步,操作:导入并运行
- 打开 Buzz,按
Ctrl+O导入音频文件(也可直接拖入) - 选好语言和模型质量;知道音频语言就手动选,准确率更高
- 点"运行",任务开始排队处理
第三步,拿结果:双击查看,导出字幕
转录完成后双击任务行,打开转录查看器,每段文字都带开始/结束时间。底部播放器可以边听边定位;"导出"菜单里保存为 SRT 即可。
四个高频场景,照着做就行
会议记录:说话人分离代替手动整理
产品或运营团队会后导入录音,开说话人识别,Buzz 把不同人的话分开放。你只做校对和删废话,不用逐句听录。
视频字幕:一条 MP4 直接出 SRT
创作者导入视频文件,Buzz 提取音轨转录,导出 SRT/VTT 拖进剪辑软件。时间戳不准的段落手动微调一下即可上线。
外语学习:播客原文配着听
学外语的人导入外语播客或课程音频,转录后对照原文听发音、查语法。Buzz 支持 99 种语言,冷门语种也有覆盖。
播客整理:长节目变可检索文字
播客主理人把单集转成文字,按时间戳快速定位某个话题,剪出金句做预告或博客素材,比拖进度条找快得多。
调优与排错:速度、准确率、格式、批量
转录速度慢
- 换小模型:老机器用 Tiny 或 Base,速度立竿见影
- 开 GPU 加速:Whisper.cpp 后端走 Vulkan,Faster Whisper 走 NVIDIA 驱动
- 关掉其他吃 CPU 的程序,别和渲染任务抢资源
设备与模型对照:
| 你的设备 | 推荐模型 |
|---|---|
| 老笔记本 / 无独显 | Tiny、Base |
| 中端 PC | Small、Medium |
| M 系列 Mac 或 N 卡 | Medium、Large-v3 |
准确率不够
- 换更大的模型,Medium 起步
- 手动指定语言,别让它猜
- 专业术语多的内容,在高级设置里加"初始提示",把术语写进去
- 录音环境降噪,能用外接麦克风就别用耳麦
格式不识别
- MP3、WAV、FLAC、OGG、MP4、MKV 等常见格式开箱即用
- 冷门格式先转成 MP3 再导入,避免解码报错
- 视频文件确认音轨存在,纯静音轨道没有内容可转
批量处理
- 一次导入多个文件,自动各建一个任务
- 队列顺序执行,每行显示进度和耗时
- 支持从 URL 导入在线音视频,省一步手动下载
给开发者
Buzz 采用 MIT 许可证,基于 Python + PyQt 构建。核心代码在buzz/transcriber/(多后端转录逻辑)和buzz/widgets/(界面组件),buzz/plugins/是扩展插件系统,buzz/db/用 SQLite 存转录历史。想参与贡献,先看 安装文档,再到项目仓库提 Issue 或 PR 即可。
Buzz 把 Whisper 完整搬进本地:零订阅、不上传、离线可跑。打开应用,按Ctrl+O拖入第一段录音,几分钟后你会拿到一份带时间戳的字幕文件。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考