news 2026/9/6 20:27:29

Buzz 离线语音转文字完整指南:5 分钟让 Whisper 在本地跑起来

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字完整指南:5 分钟让 Whisper 在本地跑起来

Buzz 离线语音转文字完整指南:5 分钟让 Whisper 在本地跑起来

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

开完会,桌上躺着一段两小时的录音,第二天上午就要交文字稿。把它丢给云端转录服务,代价是按分钟计费,外加文件必须先传到别人服务器上。Buzz 是把这套流程搬到本地的工具:基于 OpenAI 的 Whisper 模型,识别、翻译、导出全部在你自己的电脑上完成,录音从头到尾不出机器。

装好并跑起来

三个平台都有现成方案:

  • Windows / macOS:从发布页下载安装包或 .dmg 拖进 Applications 即可;Windows 版本没有数字签名,安装时按"更多信息 → 仍要运行"放行
  • Linux:Flatpak 或 Snap 包管理器直接装
  • Python 用户:走 pip,需要 Python 3.12 环境并先装好 ffmpeg
# pip 方式安装并启动 Buzz(约一行装好,第二行启动) pip install buzz-captions python -m buzz

装完打开主界面,左上角就是导入按钮。详细的各平台安装说明见 安装文档。

从一段录音到字幕文件

导入音频或视频文件(视频会自动抽音轨),第一次使用要先选模型并等待下载——模型只下载一次,之后离线可用。任务类型分两种:transcribe 识别原语言,translate 则直接产出英文译文。建议第一遍就把手动指定语言打开,比自动检测稳。

跑完后双击任务行打开转录查看器:波形、文本、播放条三件套,拖动播放位置对应文字会高亮,哪句听着别扭就回听哪句。确认没问题后导出,TXT、SRT、VTT 三种格式任选。

让识别更准的 4 个设置

准确率主要看这几个开关,按顺序调收益递减:

  1. 手动指定语言:短文件和方言内容自动检测容易翻车,指定语言后识别率提升最明显
  2. 填写初始提示:录音里有专有名词、产品名、术语,把它们写进提示框,模型会倾向于按你给的词认
  3. 换更大的模型:tiny 够快速粗览,正式内容建议 medium 或 large;NVIDIA 显卡、Apple Silicon、大多数核显(Vulkan 路径)都有加速,大模型也能跑得动
  4. 开启语音分离:嘈杂环境录的音,Buzz 会在转录前先把人声分离出来,比单纯降噪有效

模型下载、删除、量化版本(牺牲一点精度换速度)都在偏好设置的模型页管理,偏好文档里有完整说明。

说话时实时转文字

Buzz 不只能处理存好的文件,还支持麦克风实时转录:点录制按钮,说出来的话立刻变成文字往下排。三种模式可选——新句子追加到下方、追加到上方、或"追加并纠正"(会对上一句的识别错误做二次修正,吃硬件性能)。演讲和会议场景可以开演示窗口全屏显示实时文字;开启实时导出后,文字还会边生成边写进 txt 文件,方便同步给别的程序。

文件多起来之后怎么办

一批访谈录音或整季讲座,别一个一个拖:

  • 文件夹监视:在偏好里设好输入目录和输出路径,新文件落进文件夹就自动开始转录,"会一结束文件丢进去"这种工作流完全不用人盯
  • 命令行buzz add一条命令就能指定模型、语言、提示词并直接导出 SRT/VTT,适合写脚本批量跑,全部参数见 CLI 文档
  • 插件扩展:内置插件系统提供 AI 摘要、字幕自动拆行等能力,源码在 buzz/plugins/,想加自己的功能也有现成骨架

做字幕的话还有一个拆行工具:按静音间隙合并、按标点分割,逐条调整每条字幕的时长再导出,省掉字幕编辑器里的大部分手工活。

Buzz 和云端转录服务怎么选

维度Buzz云端转录服务
文件去向留在本机上传到服务商服务器
网络下载模型后离线可用依赖网络
费用免费按分钟计费
速度取决于你的硬件取决于对方服务器排队
语言覆盖99+ 种因服务而异
可控性模型、提示词、导出模板都能调基本不可调

涉及客户信息、商业机密的音频,"文件不出机器"这一条就是决定性的;偶尔一段小音频求快,用云服务也无妨,不必硬上本地。

下一步做什么

  1. 装上 Buzz,找一段短音频,用 base 模型走一遍"导入 → 运行 → 查看器"
  2. 指定语言、填上几个关键词的初始提示,对同一段音频再跑一次,对比识别差异
  3. 打开文件夹监视、固定输出目录,之后的批量文件丢进去就行

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 20:25:22

SAP最佳实践:从业务流程到系统落地的完整指南

简介:这是一份面向 SAP 实施顾问、项目管理人员及企业信息化决策者的中文版《SAP 最佳实践介绍》PPT。内容系统梳理了 SAP Best Practices 的概念、预配置特性与 Building Block 原理,并对其在 SAP All-in-One、行业及跨行业解决方案中的应用场景、安装方…

作者头像 李华
网站建设 2026/9/6 20:20:32

IEC 61709:2017可靠性预计实战:参考条件与应力模型解析

简介:这份资源是国际电工委员会发布的IEC 61709-2017标准原版电子文档,面向电子组件可靠性设计、失效分析与质量管控人员,替代被撤销的IEC TR 62380,为元器件故障率预计及不同环境间的应力换算提供统一依据。文档为单个PDF文件&am…

作者头像 李华
网站建设 2026/9/6 20:17:53

3步在Linux上跑Windows应用:WinBoat快速上手

3步在Linux上跑Windows应用:WinBoat快速上手 【免费下载链接】winboat Run Windows apps on 🐧 Linux with ✨ seamless integration 项目地址: https://gitcode.com/GitHub_Trending/wi/winboat 你每天要用的那个软件只有 Windows 版&#xff0c…

作者头像 李华