Buzz 离线语音转文字完整指南:5 分钟让 Whisper 在本地跑起来
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
开完会,桌上躺着一段两小时的录音,第二天上午就要交文字稿。把它丢给云端转录服务,代价是按分钟计费,外加文件必须先传到别人服务器上。Buzz 是把这套流程搬到本地的工具:基于 OpenAI 的 Whisper 模型,识别、翻译、导出全部在你自己的电脑上完成,录音从头到尾不出机器。
装好并跑起来
三个平台都有现成方案:
- Windows / macOS:从发布页下载安装包或 .dmg 拖进 Applications 即可;Windows 版本没有数字签名,安装时按"更多信息 → 仍要运行"放行
- Linux:Flatpak 或 Snap 包管理器直接装
- Python 用户:走 pip,需要 Python 3.12 环境并先装好 ffmpeg
# pip 方式安装并启动 Buzz(约一行装好,第二行启动) pip install buzz-captions python -m buzz装完打开主界面,左上角就是导入按钮。详细的各平台安装说明见 安装文档。
从一段录音到字幕文件
导入音频或视频文件(视频会自动抽音轨),第一次使用要先选模型并等待下载——模型只下载一次,之后离线可用。任务类型分两种:transcribe 识别原语言,translate 则直接产出英文译文。建议第一遍就把手动指定语言打开,比自动检测稳。
跑完后双击任务行打开转录查看器:波形、文本、播放条三件套,拖动播放位置对应文字会高亮,哪句听着别扭就回听哪句。确认没问题后导出,TXT、SRT、VTT 三种格式任选。
让识别更准的 4 个设置
准确率主要看这几个开关,按顺序调收益递减:
- 手动指定语言:短文件和方言内容自动检测容易翻车,指定语言后识别率提升最明显
- 填写初始提示:录音里有专有名词、产品名、术语,把它们写进提示框,模型会倾向于按你给的词认
- 换更大的模型:tiny 够快速粗览,正式内容建议 medium 或 large;NVIDIA 显卡、Apple Silicon、大多数核显(Vulkan 路径)都有加速,大模型也能跑得动
- 开启语音分离:嘈杂环境录的音,Buzz 会在转录前先把人声分离出来,比单纯降噪有效
模型下载、删除、量化版本(牺牲一点精度换速度)都在偏好设置的模型页管理,偏好文档里有完整说明。
说话时实时转文字
Buzz 不只能处理存好的文件,还支持麦克风实时转录:点录制按钮,说出来的话立刻变成文字往下排。三种模式可选——新句子追加到下方、追加到上方、或"追加并纠正"(会对上一句的识别错误做二次修正,吃硬件性能)。演讲和会议场景可以开演示窗口全屏显示实时文字;开启实时导出后,文字还会边生成边写进 txt 文件,方便同步给别的程序。
文件多起来之后怎么办
一批访谈录音或整季讲座,别一个一个拖:
- 文件夹监视:在偏好里设好输入目录和输出路径,新文件落进文件夹就自动开始转录,"会一结束文件丢进去"这种工作流完全不用人盯
- 命令行:
buzz add一条命令就能指定模型、语言、提示词并直接导出 SRT/VTT,适合写脚本批量跑,全部参数见 CLI 文档 - 插件扩展:内置插件系统提供 AI 摘要、字幕自动拆行等能力,源码在 buzz/plugins/,想加自己的功能也有现成骨架
做字幕的话还有一个拆行工具:按静音间隙合并、按标点分割,逐条调整每条字幕的时长再导出,省掉字幕编辑器里的大部分手工活。
Buzz 和云端转录服务怎么选
| 维度 | Buzz | 云端转录服务 |
|---|---|---|
| 文件去向 | 留在本机 | 上传到服务商服务器 |
| 网络 | 下载模型后离线可用 | 依赖网络 |
| 费用 | 免费 | 按分钟计费 |
| 速度 | 取决于你的硬件 | 取决于对方服务器排队 |
| 语言覆盖 | 99+ 种 | 因服务而异 |
| 可控性 | 模型、提示词、导出模板都能调 | 基本不可调 |
涉及客户信息、商业机密的音频,"文件不出机器"这一条就是决定性的;偶尔一段小音频求快,用云服务也无妨,不必硬上本地。
下一步做什么
- 装上 Buzz,找一段短音频,用 base 模型走一遍"导入 → 运行 → 查看器"
- 指定语言、填上几个关键词的初始提示,对同一段音频再跑一次,对比识别差异
- 打开文件夹监视、固定输出目录,之后的批量文件丢进去就行
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考