news 2026/9/6 20:18:29

Buzz 离线语音识别工具使用指南:音频转文字、录音转字幕的完整教程

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音识别工具使用指南:音频转文字、录音转字幕的完整教程

Buzz 离线语音识别工具使用指南:音频转文字、录音转字幕的完整教程

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的离线语音识别工具,运行在你自己的电脑上,可以把音频文件、视频和麦克风录音转成带时间戳的文字,并导出 TXT、SRT、VTT 等格式。录音不用上传到任何服务器,转录全程在本机完成。

如果你经常要处理这类素材:开完会留下一堆录音没人整理、采访完的磁带迟迟变不成文字稿、本地视频想要一套字幕文件——Buzz 解决的就是这些事。它把 Whisper 模型跑在你的电脑上,导入文件后点一下就开始转,转完还能在界面里逐句核对、改时间轴、导出字幕。

它能帮你做什么

按使用场景来说,主要有四类活:

  • 文件批处理:一次导入多个音频或视频,排队逐个转录,还能直接粘贴 URL 导入在线视频。
  • 实时录音:对着麦克风边说边出文字,适合会议、讲座、采访现场,还支持把文字实时导出成文本文件。
  • 多语言转录与翻译:支持 Whisper 的全部语言;翻译成英文是模型自带能力,翻成其他语言可以接一个 AI 接口完成。
  • 字幕整理:转录结果带精确时间戳,可以调字幕长度、合并分句,导出 SRT/VTT 直接投到播放器或剪辑软件里。

安装 Buzz:三种方式任选其一

Buzz 支持 Windows、macOS 和 Linux,三种装法对应不同人群:

  • Mac / Windows 用户:去项目发布页下载对应系统的安装包(.dmg / .exe)。注意 Windows 安装包没有签名,安装时系统会警告,选"更多信息 → 仍要运行"即可。
  • Linux 用户:从应用商店装 Flatpak 或 Snap 最省事,见下面命令。
  • 想从源码装或习惯命令行的用户:直接 pip 安装。

Linux 下装 Flatpak 版:

flatpak install flathub io.github.chidiwilliams.Buzz

pip 方式(各系统通用,Linux 需先装好系统依赖,清单见 官方安装文档):

pip install buzz-captions python -m buzz

装完双击图标或执行python -m buzz就能打开主界面。

第一次打开软件,先改哪几项

Ctrl + ,(Mac 是Cmd + ,)打开偏好设置,先做三件事,后面用起来就顺了:

  1. 导出文件夹:点 Browse 选一个固定目录,比如"桌面/Buzz导出",所有转录结果都会存到这里。
  2. 默认导出文件名:默认模板已包含文件名、任务类型和时间,一般不用动;嫌长可以简化。
  3. 下载一个模型:切到 Models 标签页,先下载一个basesmall大小的模型。模型首次使用时联网下载,之后就存在本地缓存里,之后可以完全离线用。

其他选项(字体大小、实时录音导出开关等)保持默认即可,需要时再回来调。

场景一:把音频文件批量转成文字稿

目标:把几个录音文件一次性转成文字,拿到 TXT 文本。

操作步骤:

  1. 点左上角的+按钮(或按Ctrl + O),选择多个音频/视频文件,文件会进入任务列表。
  2. 对每个任务确认三列设置:模型(如 Faster Whisper / Whisper.cpp)、任务(Transcribe 转录 / Translate 翻译成英文)、语言。
  3. 语言建议手动指定,别用自动检测——选对语言,识别质量通常明显更好。
  4. Run,状态列会从 Queued 变到 In Progress,再变 Completed,括号里就是耗时。
  5. 双击已完成的那一行,打开转录查看器,核对内容后点Export导出 TXT。

最终产出:一个带完整文字内容的 .txt 文件,落在你设置的导出目录里。文件名按偏好设置里的模板生成。

转长文件时可以顺手做两个动作(在导入时展开Advanced选项):勾选Word-Level Timings得到逐字时间戳,后续能做精细字幕调整;Initial prompt里填容易拼错的专有名词,比如人名、产品名,能减少错拼。

场景二:开会录音,边说边出文字

目标:会议进行中实时把发言变成文字,散会直接带走一份文字稿。

操作步骤:

  1. 点主界面工具栏的麦克风图标进入实时录音。
  2. 选好麦克风设备和语言,点Record开始。文字会一句句出现在右侧。
  3. 如果想在会中就把文字留下来,去偏好设置里勾选Enable live recording transcription export,Buzz 会边录边把文字写进一个文本文件。
  4. 演讲现场还可以打开Presentation window,把实时字幕投到大屏上。

最终产出:一份实时滚动、持续写入文件的会议文字稿。

两个注意点:

  • 实时转录比文件转录吃性能,建议选 Whisper.cpp 实现 + 较小的模型,笔记本也能跑动。
  • 想录电脑里播放的声音(而不是麦克风)需要装一个虚拟音频设备(macOS 的 BlackHole、Windows 的 VB CABLE、Linux 的 PulseAudio 路由),细节见 官方使用文档。

录音功能的实现可以看 录音模块源码,想理解它内部怎么分段转录的可以从这里入手。

场景三:把转录结果整理成可用字幕

目标:给视频配一套时长、字数都合适的 SRT 字幕。

转录完成后的查看器就是工作台:

  1. 核对:底部有播放器,点哪一句哪句高亮,Ctrl + F可以全文搜索关键词快速定位。
  2. 改时间轴:选中某句,用Ctrl + ←/→以 0.5 秒为步长微调起止时间,改错的时间戳不用手打数字。
  3. 调字幕长度:点工具栏的Resize,设置每条字幕的最大长度和是否按标点断句,点 Merge 自动重排——原本一句太长或碎成几行的字幕会被合并成阅读舒服的长度。
  4. 导出Export菜单里选 SRT、VTT、TXT 或 JSON。

最终产出:一份时间轴准确、断句合理、可直接导入剪辑软件的字幕文件。

模型怎么选、还有哪些进阶项

模型是"速度 vs 准确率"的取舍,记住一个原则就行:先用小模型跑通流程,不满意再换大的。

  • tiny / base:几秒出结果,适合快速预览和长音频;
  • small / medium:日常够用,推荐作为默认;
  • large-v3 系列:准确率最高,但慢、吃内存,长音频要等。

实现方式(Whisper 类型)也影响速度:没有独立显卡或 Mac 上,选Whisper.cpp;有 6GB 以上显存的 NVIDIA 显卡,选Faster Whisper会快很多。模型管理界面在偏好设置的 Models 标签页,已下载和可下载的模型都列在那里,还可以下载量化版(如 q5)省内存。

其他值得知道的进阶项:

  • 快捷键:偏好设置的 Shortcuts 标签页可自定义,常用的有Ctrl + F搜索、Ctrl + P播放/暂停、Ctrl + G跳到当前播放位置。
  • 说话人分离:多人对话的音频,Buzz 支持先做说话人分离再转录,还能给每句标注说话人,见 使用文档。
  • 命令行:不想开界面时,buzz add --srt 文件.mp4这类命令可以直接跑转录,完整参数见 CLI 文档。

常见问题排查清单

按"现象 → 原因 → 处理"顺序自查:

现象可能原因处理办法
转录很慢,排队等很久模型太大,或纯 CPU 运行换 small/base 模型;有显卡改用 Whisper.cpp 或 Faster Whisper;关掉占资源的程序
点录音没反应,报 PaErrorCode-9999系统禁止了应用访问麦克风检查系统隐私设置里的麦克风权限(Windows:设置 → 隐私 → 麦克风);临时关掉杀毒软件测试
识别出来的语言不对、乱码自动检测猜错了语言手动指定语言,不要依赖 Detect Language
专有名词、人名总是拼错Whisper 对生词容易错拼在 Advanced → Initial prompt 里把正确的写法填进去
字幕一行太长或太碎默认分句不适合你的视频导入时开 Word-Level Timings,再用 Resize 的 Merge 按最大长度和标点重排
Buzz 启动就崩,或转录中途崩模型下载不完整或损坏;CPU 太老不支持 AVX2在 Models 页删掉已下载的模型重新下载;特别老的电脑无法运行,这是硬件限制
想在完全没网的电脑上用模型需要首次联网下载在有网机器上下载好模型,把模型缓存目录整个拷到离线电脑的相同位置(缓存位置可在 Models 页点 Show file location 查看)

更多问题可以先查 官方 FAQ。

适合谁、接下来做什么

Buzz 适合手里有一堆录音和视频、需要文字稿或字幕,又希望数据不出本机的用户:记者、学生、会议记录者、字幕组。

下一步建议:装好之后先用一段 1 分钟左右的录音 + base 模型走通"导入 → 转录 → 导出 TXT"全流程,再按场景二、场景三的要求往实时录音和字幕整理上走。详细文档入口:安装说明、偏好设置、CLI 用法,源码在仓库根目录的 buzz/ 下,界面、转录器、数据库分层清晰,可以按需阅读。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 20:17:53

3步在Linux上跑Windows应用:WinBoat快速上手

3步在Linux上跑Windows应用:WinBoat快速上手 【免费下载链接】winboat Run Windows apps on 🐧 Linux with ✨ seamless integration 项目地址: https://gitcode.com/GitHub_Trending/wi/winboat 你每天要用的那个软件只有 Windows 版&#xff0c…

作者头像 李华
网站建设 2026/9/6 20:16:34

JESD209-4_3精解:LPDDR4标准关键差异与调试实战

简介:针对JEDEC LPDDR4与LPDDR3规范的实战精讲文档由cxsjabcabc编写,旨在帮助DRAM开发、嵌入式硬件工程师及内存爱好者快速理解JEDEC标准。文档采用问答形式,重点拆解LP4与LP4X电压差异、Apple M1统一内存架构背后的设计逻辑、LPDDR4是否内置…

作者头像 李华
网站建设 2026/9/6 20:16:31

WeChatMsg 微信聊天记录导出教程:HTML/Word/CSV 三种格式本地备份指南

WeChatMsg 微信聊天记录导出教程:HTML/Word/CSV 三种格式本地备份指南 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Tr…

作者头像 李华
网站建设 2026/9/6 20:15:13

MaxKB 开源知识库问答系统:十分钟完成部署与落地

MaxKB 开源知识库问答系统:十分钟完成部署与落地 【免费下载链接】MaxKB 🔥 MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。 项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKB …

作者头像 李华
网站建设 2026/9/6 20:15:11

WandEnhancer 免费增强方案:Wand/WeMod 客户端本地扩展完整指南

WandEnhancer 免费增强方案:Wand/WeMod 客户端本地扩展完整指南 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer WandEnhancer 是一个开…

作者头像 李华