Buzz 离线转录:3 步完成语音转文字,文件不出本地
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议录音结束,不必把音频上传云端排队处理:打开 Buzz,导入那个 MP3,几分钟后带时间戳的转录稿和译文就出现在屏幕上,全程没有离开这台电脑。Buzz 是一款基于 OpenAI Whisper(开源语音识别模型)的离线转录与翻译工具,在你自己的电脑上完成语音转文字和翻译。
项目速览
- 定位:桌面端离线音频转录、翻译与字幕导出工具
- 平台:Windows、macOS(Intel 与 Apple Silicon)、Linux(Flatpak / Snap)
- 技术栈:Python 3.12 + PyQt6(跨平台图形界面框架),多种 Whisper 后端
- 支持语言:约 99 种
- 导出格式:TXT、SRT、VTT
- 许可证:MIT,可自由使用与修改
核心体验
🎧 导入文件,任务即建
把 MP3、MP4 拖进主界面,或点“导入媒体文件”,Buzz 会自动提取音频轨道并生成一条独立任务。在任务行里选定任务类型、语言和模型大小,点“运行”开始处理,多文件可一次添加、排队执行。
📝 按时间戳打开查看器逐段校对
任务完成后双击任务行进入转录查看器。点任一片段,音频从该时刻播放;拖动片段边界,让文字与语音重新对齐;搜索框输入关键词可直接跳转,片段还能拆分、合并或删除。
🎙️ 边说边转的实时录音
切到“实时录音”,选好麦克风和语言,按录音键即可。文字随着讲话流式出现,延迟默认 20 秒可调,避免同步错位。做演示或讲座时还能打开单独的展示窗口,把字幕投到第二块屏幕上。
能力拆解
按硬件挑后端
Buzz 内置多种 Whisper 实现,在“偏好设置”里切换,差异主要在速度、精度和资源占用:
| 后端 | 适用场景 |
|---|---|
| whisper(PyTorch 原版) | 最稳定,Nvidia GPU 有 CUDA 加速 |
| whisper.cpp | 轻量,Vulkan(通用显卡的 GPU 加速)可跑集成显卡 |
| faster-whisper | 偏重转录速度 |
| Hugging Face 模型 | 按模型 ID 使用社区发布的各类模型 |
每个后端内还能从 tiny 到 large 选模型尺寸:越小跑得越快,越大越准,代价是内存占用更高。
字幕级的后处理
转录完才是开始。Buzz 把结果当字幕轨来管:按字符数、时间间隔拆分,或按标点智能分段;每段的起止时间可手动微调,让节奏与语音贴合。最终导出 SRT、VTT 可直接进剪辑软件。长音频可先做语音分离(把人声从背景噪音中抽离)再转录,还能用说话人识别给片段标记不同的讲话者。
批量与自动化
“监听文件夹”指定一个目录后,新放进来的音频自动排队转录。命令行接口(用文本指令运行程序的方式)同样可用:一条buzz add可以传多个文件、指定后端、语言和导出格式,--hide-gui隐藏窗口便于塞进脚本,完整参数见 cli.md。
动手指南
3 步装好
- macOS 下载 .dmg 安装;Windows 下载安装包,出现安全提示选“更多信息”再“仍要运行”
- Linux 用 Flatpak:
flatpak install flathub io.github.chidiwilliams.Buzz- 开发者通道(需 ffmpeg 与 Python 3.12):
pip install buzz-captions python -m buzz4 步跑通第一次转录
- 导入媒体文件(Ctrl/Cmd+O)。
- 在任务行选择任务(transcribe 转录 / translate 翻译)、语言和模型大小。
- 点“运行”,等进度条走完。
- 双击任务行查看结果,按需导出 SRT 或 TXT。
适用人群与边界
谁适合
- 学生:课堂录音、外语播客转成可检索的文字,还能把原文直接译成能读懂的目标语言辅助学习。
- 内容创作者:给视频批量出 SRT 字幕,或用监听文件夹把一整批播客音频排队处理。
- 小团队:处理不便上传外部服务的内部会议录音,本地运行意味着数据不出内网。
不适用的场景
Buzz 的精度上限就是 Whisper 本身:环境嘈杂、多人抢话、口音较重时准确率都会下降,只能换更大的模型多等一会儿。几小时的长音频对内存和磁盘要求不低,首次下载模型文件也占空间。没有 Web 版,结果只能在处理机器上查看;Windows 安装包未签名,首次安装会弹警告,属正常现象。
进阶与生态
插件机制按目录组织:一个包含plugin.py的目录声明元数据与生命周期钩子,即可接入转录前后处理,官方已带 AI 摘要、自动字幕调整等插件,示例都在 plugins/。转录核心逻辑在 buzz/transcriber/,想改代码可直接克隆仓库:
git clone https://gitcode.com/GitHub_Trending/buz/buzzBuzz 能覆盖本机“音频变文字”的大部分场景。手上有待转录的文件时,装好用它跑一遍最小的文件试试即可,源码按上面的命令克隆下来就能读。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考