news 2026/9/7 23:25:46

Buzz:从录音到逐字稿的 5 分钟离线语音识别

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz:从录音到逐字稿的 5 分钟离线语音识别

Buzz:从录音到逐字稿的 5 分钟离线语音识别

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

周五下午四点,一场 40 分钟的跨部门会议刚散场,你要在今晚复盘前拿到逐字稿。把录音拖进 Buzz,几分钟后一份带时间戳的文本就躺在桌面,整个过程音频文件没有离开过这台电脑。这就是 Buzz 主打的离线语音识别:模型和音频都在本地,没有上传环节。

一分钟搞清楚 Buzz 是什么

Buzz 是一个桌面应用,内核是 OpenAI 开源的 Whisper 模型(把声音转成文字的大模型)加若干本地推理后端,把它理解成 Whisper 的桌面客户端就对了。它装在 Windows、macOS 或 Linux 上,转录和翻译都跑在你自己的机器里,只有第一次下载模型权重需要联网。适合不想把会议、访谈、课程录音交给第三方服务的个人和团队。跑起来之后你会发现,它更像一台本地录音转写工作台:批量排队、说话人标注、字幕导出都是流程的一部分。

从下载到出第一条逐字稿

  • Windows:从官方渠道下载安装包,安装向导会提示应用未签名,点“更多信息”→“仍要运行”即可装完。
  • macOS:下载 .dmg,把应用拖进应用程序文件夹,Apple Silicon 芯片原生加速。
  • Linux:终端执行flatpak install flathub io.github.chidiwilliams.Buzz(Flatpak 是把应用装在独立沙箱里的 Linux 打包格式);或执行sudo snap install buzz安装 Snap 包。
  • 开发者版:需要 Python 3.12 并预装好 ffmpeg,然后:
pip install buzz-captions python -m buzz

第一次转录:点工具栏“+”号(或 Ctrl/Cmd+O)选中一段录音,任务保持默认的 transcribe,点 Run。状态列显示 Completed 后,双击那一行打开转录页。

音频怎么进来,逐字稿怎么出去

输入有三种入口:

  • 文件:MP3/WAV/FLAC/M4A/OGG 音频、MP4/MKV 等视频(自动抽音频),用拖拽或 Ctrl/Cmd+O 触发;
  • 链接:把 YouTube 地址当任务粘贴进去,Buzz 先下载再转录;
  • 实时:点麦克风按钮从麦克风实时转写,还能开演示窗口投到大屏上。

中间能做的事:

  • 批量排队:一次加入多个文件,每行可以指定不同模型,任务表逐行显示进度;
  • 语音分离:嘈杂的音频可勾选“Extract speech”,先把人声抽成干净音轨再转;
  • 说话人识别:在转录页点“Identify speakers”,每位说话人自动打标,可试听 10 秒样本并把标签改成真名。

产出有三种格式:TXT、SRT、VTT,文件名支持模板变量(原文件名、任务、日期等);字幕长短可在转录页用 Resize(字幕长度调整)合并过近的片段或按标点切分;外语材料选 translate 任务,输出直接是译文。

三个可照抄的录音处理工作流

工作流一:会议纪要

  • 目标:会前拿到可分发的纪要底稿。
  • 关键配置:导入录音 → 手动指定语言(自动检测偶尔会判错)→ 在“高级”里把容易拼错的人名、术语写进 Initial prompt → 点 Run。
  • 你拿到的产出:带时间戳的逐字稿,改完导出 TXT。

工作流二:访谈整理

  • 目标:一两个小时访谈出按人分组的文字稿。
  • 关键配置:导入文件 → 转录视图点“Identify speakers” → 把每个标签改成“采访人/受访者” → 勾选“Merge speaker sentences”保存。
  • 你拿到的产出:按说话人归段的文字稿,导出 TXT。

工作流三:视频字幕

  • 目标:拿到一套能直接导入剪辑软件的字幕。
  • 关键配置:导入视频(自动抽音频)→ Export As 选 SRT → 字幕行过长就用 Resize 按间隙合并 → 导出。
  • 你拿到的产出:.srt 文件。

什么时候需要动模型和参数

默认设置(transcribe 任务 + 较小的模型)对付日常听写已经够用,下面这些情况才需要动手:

模型大小开销转录速度什么时候选它
tiny最小,低内存机器可跑最快首次试用、快速校对
base略大日常会议录音
small中等准确率要求开始抬头的场景
medium明显偏大,建议有显卡较慢重要访谈与讲座
large最大,显存要求高最慢把准确率放在第一位的场合
  • 加速:NVIDIA 显卡可启用 CUDA 后端,Mac 走 Apple Silicon 原生加速,普通独显还有 Vulkan 选项。
  • 命名与自动化:在偏好设置里配默认导出文件名模板(支持{{ input_file_name }}等变量);开启 Folder Watch(文件夹监视)指定一个目录,新录音自动转录导出,适合接 OBS 的录像输出目录。
  • 插件:菜单里打开 Plugins 面板,AI 摘要、DOCX 导出、跳过已转录文件等内置插件按需勾选即可。

五个值得先看的目录

  • buzz/transcriber/ — 各个转录后端:本地 Whisper、whisper.cpp、Hugging Face 模型、OpenAI API。
  • buzz/widgets/main_window.py — 主窗口:任务表与工具栏。
  • buzz/widgets/transcription_viewer/ — 转录视图页:编辑、播放、说话人识别、字幕调整。
  • buzz/widgets/preferences_dialog/ — 全部偏好设置页。
  • buzz/plugins/ — 插件系统与内置插件。

离线语音识别的边界与已知限制

  • 常见误解:“离线”不等于“永不联网”。首次使用某个模型要联网下载权重文件,YouTube 链接任务也要联网拉视频。
  • 性能边界:速度与模型大小成反比,laptop 用 large 转一小时录音可能要好几个小时;没显卡的机器建议小文件或分批夜间跑。
  • 已知不足:Intel 版 Mac 上说话人识别不可用;超长文件先分段再转更稳,单个任务长期占着队列,进度不好把控。

把离线语音识别接进你的工作流

挑一条最近的会议录音,用默认设置跑一遍,导出 SRT 看看字幕长短是否够用。想再省事一点,就把 Folder Watch 指向 OBS 的录像输出目录,第二天早上导出文件夹里已经躺着当天的稿子。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 23:22:54

基于分段损耗与需求响应的多源协同阶梯碳价储能优化调度模型

做储能优化调度的朋友应该都有这种体会:模型跑通很简单,难的是把损耗、响应、碳成本这些现实因素全都塞进一个能求解的框架里。最近我把这个基于分段损耗与需求侧响应的多源协同阶梯碳价储能优化模型完整整理了一遍,全部用Python实现&#xf…

作者头像 李华
网站建设 2026/9/7 23:22:41

COMSOL相控阵三维声场模拟实操:网格、边界与后处理技巧

去年年底接了个活儿,要在COMSOL里把一个相控阵探头的三维声场算明白。说实话,相控阵声场模拟这活儿,说难不难,说简单也不简单。难的地方在于三维模型一跑起来计算量蹭蹭涨,内存和收敛问题轮着来;简单的地方…

作者头像 李华
网站建设 2026/9/7 23:20:13

C++模拟实现二叉搜索树:核心机制与踩坑实录(上)

二叉搜索树这个东西,很多学C的朋友都会遇到。面试高频、算法题常客、STL里 map/set 的底层也有它的影子,但如果只停留在“知道概念”和“刷过几道题”的层面,真让你从零模拟实现一棵可用的二叉搜索树,你会发现一堆平时根本注意不到…

作者头像 李华
网站建设 2026/9/7 23:18:25

Dify + MCP 实战:构建微信端智能理财助手与自动化推送系统

简介:面向金融科技开发者,这份PDF教程完整讲解基于Dify与MCP协议构建智能金融理财助手的全过程,尤其适合有Python基础、希望落地AI智能体与微信自动化推送的工程师。资源共1个PDF文件,压缩包约248KB,内容涵盖核心能力架…

作者头像 李华
网站建设 2026/9/7 23:18:23

单用户模式修改银河麒麟V10密码:完整实操指南

简介:《银河麒麟桌面V10(sp1)用户密码修改指南》是一份面向系统个人用户与运维人员的应急实操手册,专门解决忘记登录密码后无法正常进入系统的问题。内容覆盖X86与ARM双架构,从启动主机进入grub界面讲起,给出在linux行末添加“ini…

作者头像 李华