Buzz完整指南:5分钟跑通本地离线语音转文字,录音到SRT字幕一步到位
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
你有没有过这样的经历:把一段采访录音发给云端转录服务,之后反复担心它被拿去训练或外泄?开完40分钟的会,还要逐句听回音、手动敲纪要?Buzz是基于OpenAI Whisper的桌面工具,主打离线语音转文字——所有音频留在你自己的电脑里处理,直接给你带时间戳的文本和字幕。不用注册、不用上传,装完就能用。
手工敲字幕和云端转录,到底卡在哪
几个真实的场景,看看是不是你的日常:
- 视频创作者剪片子:40分钟的vlog要配字幕,只能一边倒带一边手敲台词、对时间轴,一个下午就耗在字幕上
- HR或法务整理访谈:录音里涉及候选人薪酬、当事人陈述,发给第三方在线平台心里不踏实,但逐字听写又太慢
- 记者批量处理外访录音:一次出差回来十几条录音,按分钟计费的云端服务成本高,而且每个文件都要手动上传、下载
- 做分享、发布会需要即时文字:在线转录工具要么要联网上传,要么延迟大,很难撑住现场
这些麻烦的共同点不在"能不能转",而在"音频必须离开你的设备,或你必须手动干最脏的活"。Buzz的思路是把这两件事同时干掉。
本地处理给你带来什么
- 音频不落地到任何服务器:转录在你的CPU或GPU上完成,唯一需要联网的环节是首次下载模型
- 转录和翻译二合一:同一个任务里既能转写成原文,也能翻译成目标语言,不用来回切工具
- 字幕直接交付:导出SRT、VTT、TXT三种格式,字幕文件拿到视频软件里就能用
- 批量与自动化:多文件排队处理,还可以开启文件夹监视,新录音落盘即自动转录
- 可扩展:插件系统提供AI摘要、降噪、文档导出等能力,不用改代码就能叠加
Buzz功能全景:输入、处理、输出三层看
输入端——素材怎么进来
- 本地音频/视频文件:MP3、WAV、FLAC、M4A、MP4、MKV等,视频会自动提取音轨
- 网络链接:直接粘贴YouTube等URL导入
- 麦克风实时录音:支持现场活动用的演示窗口,把实时文字投到另一块屏上
处理端——引擎怎么选
- 多个Whisper后端:Whisper、Whisper.cpp、Faster Whisper、Hugging Face模型,以及OpenAI Whisper API
- 硬件加速:Nvidia GPU走CUDA,多数独立/核显GPU走Vulkan,Mac用Apple Silicon原生跑
- 语音分离:转录前先把人声从背景噪声里抽出来,嘈杂录音的准确率明显受益
- 说话人识别:在转录结果里自动区分不同说话人,对话结构一目了然
输出端——结果怎么出去
- 导出TXT、SRT、VTT,插件还能加DOCX
- 转录查看器:逐段编辑、搜索、播放控制、倍速调节
- 字幕调整工具:按间隙合并、按标点切分,控制每条字幕的时长
安装与首次运行:每个平台3步以内
Windows与macOS
- 到SourceForge的buzz-captions下载页拿对应安装包(Windows是exe,macOS是dmg)
- Windows因应用未签名会弹警告,点"更多信息"→"仍要运行"即可
- 打开应用,首次使用时下载一个模型,之后彻底离线
Linux
flatpak install flathub io.github.chidiwilliams.Buzz或者用Snap:
sudo snap install buzzPython环境安装
适合开发者:先装好ffmpeg,用Python 3.12环境,然后:
pip install buzz-captions python -m buzz命令行首跑
Buzz自带CLI,一条命令就能完成"转录+导出SRT":
buzz add -m whispercpp -s small --srt --vtt ~/Downloads/meeting.mp4常用参数:-t选任务(transcribe/translate)、-m选后端、-s选模型大小、-l指定语言、--txt/--srt/--vtt选导出格式。不指定语言时会自动检测。
界面走查:四个关键位置
任务管理主界面
- 把音频或视频拖进来即可加入转录队列,也可以粘贴URL
- 每个任务一行,状态、所用模型、进度一目了然
- 支持多任务并行排队,长音频和大文件互不阻塞
- 顶部工具栏覆盖导入、实时录音等高频操作
转录查看器
- 文本按片段逐段展示,带时间戳,点击即可跳到对应音频位置
- 支持全文搜索、播放控制和倍速调节
- 每段文字可直接编辑,改完即保存
- 导出菜单在这里,TXT、SRT、VTT按格式选
偏好设置与模型管理
- 常规页可配API密钥、Base URL,以及默认导出文件名模板
- 模板支持变量,比如按输入文件名、任务、日期自动拼出导出名
- 实时转录有三种模式:追加在下方、追加在上方、追加并纠错
- 在这里下载新模型、删除用不上的旧模型
- 不同后端(Whisper、Whisper.cpp等)的模型分开管理
- 磁盘空间紧张时优先清理不用的大模型
字幕调整工具
- 针对导出的SRT/VTT做二次整形,不用重跑转录
- 可按音频间隙合并过短的片段
- 可按标点切分过长的字幕
- 设置期望的每条字幕时长,自动对齐格式
源码地图:五个核心模块
- 转录引擎目录:buzz/transcriber/ —— 文件转录、实时录音、Whisper.cpp、API等各类引擎实现
- 转录查看器:buzz/widgets/transcription_viewer/ —— 查看、编辑、导出、说话人识别等界面组件
- 实时录音界面:buzz/widgets/recording_transcriber_widget.py —— 麦克风采集与实时转录的UI逻辑
- 文件夹监视:buzz/widgets/transcription_task_folder_watcher.py —— 监听目录并自动为新文件建转录任务
- 命令行入口:buzz/cli.py ——
buzz add命令的参数解析与任务创建
插件相关逻辑集中在buzz/plugins/,每个插件一个目录,写处理逻辑后由加载器注册进系统。
实战场景:三种角色各走一条工作流
视频创作者出字幕
- 拖入成片MP4,选Whisper.cpp small模型
- 勾选SRT导出,任务完成后拿到字幕文件
- 字幕直接导入剪辑软件,再用调整工具修整时长——一个下午的字幕活缩到一杯咖啡
记者现场整理采访
- 开启实时录音转录,打开演示窗口投屏
- 采访进行中就能看到文字稿雏形,漏问的问题当场补
- 结束后导出TXT,进入编辑环节
企业自动处理会议录音
- 配置文件夹监视指向会议录音归档目录
- 配好默认导出文件名模板
- 录音一落盘就自动出文字纪要,会后不用人催
进阶调优:模型怎么选、参数怎么加
模型大小对照(相对概念,非精确指标):
| 模型 | 体积 | 速度 | 准确率 | 适合场景 |
|---|---|---|---|---|
| tiny | 最小 | 最快 | 基础 | 实时转录、低配设备 |
| base | 较小 | 快 | 良好 | 日常批量处理 |
| small/medium | 中等 | 中等 | 良好到优秀 | 正式稿件、访谈整理 |
| large | 最大 | 慢 | 最佳 | 关键会议、对准确率敏感的内容 |
常用进阶参数
-w生成词级时间戳,做逐字对齐时用-e转录前做语音分离,噪声大的录音建议加上-p给初始提示,把专有名词、术语提前告诉模型-l zh手动指定语言,比自动检测更稳- 显存紧张时选Whisper.cpp后端开Vulkan,或勾选"Reduce GPU RAM"偏好
常见问题
支持哪些格式?音频走ffmpeg,MP3、WAV、FLAC、M4A、OGG等都行;视频如MP4、AVI、MOV、MKV会自动抽音轨。
必须联网吗?转录本身完全离线。只有首次下载模型(以及用OpenAI API后端做翻译时)需要网络。
能转中文吗?可以。语言列表覆盖百余种,含普通话,-l zh即可指定。
实时转录够快吗?官方提示该功能比较吃资源,可能达不到严格意义的实时,建议用较小的模型并留意硬件配置。
能写进脚本吗?能。CLI就是为自动化设计的,buzz add ... --hide-gui可以隐藏主窗口纯后台跑。
下一步做什么
Buzz把"音频出设备"这个最大的顾虑拿掉了,剩下的只是把流程跑顺。按下面四步走,今天就能用起来:
- 按你的系统装好Buzz,下载一个base或small模型
- 挑一段真实录音跑通"导入→转录→导出SRT"全流程
- 打开偏好设置,配好默认导出文件名模板和模型目录
- 开一个归档目录试跑文件夹监视,让新录音自动转成文字稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考