news 2026/9/6 20:06:02

Buzz 离线语音转文字实战:从会议录音到批量字幕,一次跑通

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字实战:从会议录音到批量字幕,一次跑通

Buzz 离线语音转文字实战:从会议录音到批量字幕,一次跑通

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

散会后你打开那份两小时的会议录音,发现还是得逐句听、逐句敲字;外语播客里想摘几句金句,只能反复暂停打字;视频剪到一半,云端字幕服务又超时了。这三件事的共同解法,其实是同一个:Buzz,一个跑在你自己电脑上的离线语音转文字工具,底层用 OpenAI 的 Whisper 模型,整段音频只在你硬盘上处理完,没有上传环节,也就没有断网、排队和按分钟计费的问题。它覆盖 99 种语言,纯 CPU 就能转,有 NVIDIA 显卡还能再快一个数量级。

装好 Buzz,顺手跑通第一条转录

三个平台,各一条命令

系统推荐方式命令
Windowswinget 包管理器winget install ChidiWilliams.Buzz
macOSHomebrewbrew install --cask buzz
LinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz

Windows 用户注意:安装包没有做代码签名,装的时候会弹安全警告,点"更多信息"→"仍要运行"即可,源码公开可查。不想用命令行的,也可以从项目发布页直接下对应平台的安装包。

注意:装完后在终端敲一条buzz就能启动主界面。想试未发布的最新版,把仓库克隆下来(https://gitcode.com/GitHub_Trending/buz/buzz),按 README 装好依赖运行即可。

最小可行流程,五步出稿

  1. 导入文件:菜单栏"文件 → 导入媒体文件"(Ctrl/Cmd + O),MP3、WAV、MP4、MOV 都行,解码交给它内置的音频处理。
  2. 选参数:Task 选 Transcribe(同语言转写)或 Translate to English(任意语言转英文);Language 知道是什么语言就手动指定——自动检测偶尔翻车,手动选准确率明显更高;Model 新手选base就够。
  3. 点 Run:任务进队列,主界面显示实时进度。
  4. 等状态变 Completed:任务列表会记录每条任务用的模型和耗时。
  5. 双击任务行,进入转录查看器,第一份带时间戳的文字稿就出来了。

整理一场两小时会议录音

改稿和调时间戳,都在同一个窗口

查看器左上角的视图按钮提供三种模式:时间戳表格(逐段校对、做字幕用)、纯文本(合并去时间,直接粘进文档)、翻译视图(先执行过翻译才有内容)。听到 Whisper 把人名听错了?在表格里双击文本单元格直接改,改动自动保存。播放用Ctrl/Cmd + P,当前片段起点用Ctrl/Cmd + ←/→微调,终点用Ctrl/Cmd + Shift + ←/→,边听边改不用切窗口。

字幕断句怪?用 Resize 重组

一句长话被拦腰截断、该换行的不换行,是字幕最影响观感的问题。工具栏的"Resize"可以按标点分割、按静音间隙合并、限制单行最大长度,一键把散乱的段落重组成规整字幕行。

提示:Resize 的重组能力依赖词级时间戳,转录前记得勾上"word-level timestamps",否则这部分功能用不了。

导出成你能用的格式

"导出"菜单覆盖四个常用出口:TXT 进文档、SRT/VTT 进剪映和 Premiere、JSON 带完整元数据给程序处理、DOCX 继续排版。导出路径和文件名模板能在偏好设置里自定义,比如"输入文件名+转录时间",一次设好以后自动套用。

演讲或直播时出实时字幕

边说边出字,模型要换小的

切到 Live Recording 标签页,选麦克风、语言和模型,点红色 Record,文字开始逐行滚出来。

注意:实时转写对性能很敏感,务必用 Whisper.cpp 后端配tinybase小模型,大模型跟不上语速,字幕会越落越多。

投到副屏,或喂给 OBS

点"Presentation"可以单独开一个演示窗口,把实时字幕投到外接屏或直播间,当同传字幕和提词板都行。偏好设置里再打开"实时转录导出到文本文件",每生成一句就追加写盘,OBS 读这个文件就是现成的直播字幕流。

让 Buzz 听"系统声音"

想转播客或线上课程的声音,把系统输出改道给它:Windows 装 VB-CABLE,系统输出设为 CABLE Input,Buzz 里麦克风选 CABLE Output;macOS 用brew install blackhole-2ch,在"音频 MIDI 设置"里建一个多输出设备,把扬声器和 BlackHole 都勾上;Linux 打开pavucontrol,在录制标签页把目标应用的音频重定向过去。

夜里批量处理一个文件夹的音频

GUI 一个个点适合零散文件,文件一多就该让buzz add上工了——它一次可以接多个文件:

buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp3 会议录音.wav

这条命令用 Whisper.cpp 的 small 模型转录两个文件,直接落出 SRT 和 VTT 字幕。再常用的参数:--language zh指定语言;--prompt传提示词,把人名、产品名写进去,错字肉眼可见地少;--task translate则整条流水线变成翻译。把这条命令挂到系统定时任务里,夜里跑完一个文件夹,早上起来直接收稿。

模型、参数和硬件:一张表选完

档位适合场景预期
tiny/base低配电脑、实时录音、只看大意秒级出结果
small日常转录甜点区速度与准确率最均衡,多数人选它
medium/large重口音、术语密集的专业录音有 GPU 才建议上,CUDA 开好后 large 的耗时能从小时级压到分钟级

省内存就选 Whisper.cpp 的量化版,比如q_5,用一点点精度换速度和显存的大幅改善。模型都在"偏好设置 → Models"管理:左边已下载、右边待下载,勾选后点 Download,也能粘贴自定义下载地址。

NVIDIA 用户记得在偏好设置里把 CUDA 选项打开;反过来,想彻底排除显卡干扰时,设BUZZ_FORCE_CPU=true强制纯 CPU。

排错速查表

  1. 中文被听岔→ 自动检测误判了语言 → 手动把 Language 选成zh
  2. 实时字幕越滚越慢→ 实时模式用了大模型 → 换 Whisper.cpp 后端加tiny/base
  3. 字幕断句不自然→ 转录时没开词级时间戳,Resize 的重组用不了 → 重新转录并勾上 word-level timestamps。
  4. GPU 没生效→ 驱动没装好或 CUDA 没启用 → 确认偏好设置里 CUDA 可勾选;排除法可用BUZZ_FORCE_CPU=true
  5. 模型下载龟速→ 走的默认 Hugging Face 源 → 设环境变量HF_ENDPOINT=https://hf-mirror.com换国内镜像。

把声音变成你自己的文字资产

回到开头那三个场景:两小时的会议录音、反复暂停的外语播客、等着配字幕的视频——现在都有同一条出路:本地跑 Whisper,转出来的文字可搜索、可编辑、可导出,素材从头到尾没离开过你的机器。下一步很具体:今天装好 Buzz,把手头最需要整理的那段录音拖进去,点 Run;跑完导出个 SRT,你就把"听完"变成了"拥有"。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 20:04:22

基于74HC138的3-8译码器设计:原理、电路搭建与级联扩展

简介:围绕74HC138芯片展开的3-8译码器设计报告文档,面向数字集成电路课程设计、硬件电路设计初学者及电子工程相关学生,系统介绍了从功能分析、逻辑设计到电路实现与版图规划的完整流程。包体为单个DOC文件,大小约1.05MB&#xff…

作者头像 李华
网站建设 2026/9/6 20:04:22

Umi-OCR 快速上手指南:5分钟用免费离线OCR工具识别截图与PDF文字

Umi-OCR 快速上手指南:5分钟用免费离线OCR工具识别截图与PDF文字 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内…

作者头像 李华
网站建设 2026/9/6 19:55:43

流动性风险压力测试报告:设计思路、实操流程与PDF交付指南

简介:村镇银行2015年第一季度流动性压力测试报告,面向银行风险管理、合规审计与监管报送人员,展示如何在存款逐月减少、准备金率上调、市场融资减少、贷款逾期增加四类压力情景下测算90日支付能力与支付缺口率。报告以2015年3月31日为基期&am…

作者头像 李华
网站建设 2026/9/6 19:54:31

Cap开源录屏工具指南:3分钟从录屏到拿到分享链接

Cap开源录屏工具指南:3分钟从录屏到拿到分享链接 【免费下载链接】Cap Open source Loom alternative. Beautiful, shareable screen recordings. 项目地址: https://gitcode.com/GitHub_Trending/cap1/Cap Cap 是一款开源的屏幕录制工具,定位是 …

作者头像 李华
网站建设 2026/9/6 19:53:17

Atlas 驱动调优实操指南:4 款工具压低 Windows 系统延迟

Atlas 驱动调优实操指南:4 款工具压低 Windows 系统延迟 【免费下载链接】Atlas 🚀 An open and lightweight modification to Windows, designed to optimize performance, privacy and usability. 项目地址: https://gitcode.com/GitHub_Trending/at…

作者头像 李华