Buzz 上手指南:本地离线转录,免费把录音转成文字和字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 模型的本地离线转录工具:开源免费,音频处理全程不离开你的电脑,Windows、macOS、Linux 三个平台都有官方安装包。它做的事情很简单——把录音和视频变成文字稿与字幕文件,不需要账号,也不需要一直连着网。
谁适合用,谁可以不用
Buzz 是一台免费的音频转文字工具,适合它的人通常有这四种特征:
- 学生和老师:课程录音、讲座转成带时间戳的文字笔记,复习时按时间点直接跳转到对应内容,国际课程的多语言素材也能直接转。
- 视频创作者:给视频自动生成字幕,导出 SRT 后拖进剪辑软件即可,省掉逐句打轴的手工活。
- 职场人:会议、访谈边录边转,敏感内容不用出公司,数据全程留在本机。
- 研究者:十几小时的访谈录音批量转写,再配合说话人识别区分不同受访者,导出文本后直接进入分析环节。
反过来,如果你只偶尔转一两段短音频,又愿意把文件传到云端服务,那没必要专门装一套本地工具。Buzz 的价值集中在批量、离线和隐私这三件事上。
从装好到跑通:离线 Whisper 工具怎么上手
整个过程不用写代码,装好就能用。
- 安装。Windows 和 macOS 从官方发布渠道下载对应系统的安装包,按向导装完即可;Linux 提供 Flatpak 和 Snap 两种方式。Windows 安装器未签名,提示不安全时选"更多信息"再"仍要运行"。首次使用时按提示下载一个 Whisper 模型,之后缓存在本机,不重复下载。
- 导入文件。把文件拖进窗口,或点工具栏的"+"按钮手动选择,MP3、WAV、FLAC、MP4、AVI 这些常见格式都支持。附注:快捷键 Ctrl+O(macOS 为 Cmd+O)与按钮等效;粘贴 YouTube 链接也能直接导入,Buzz 会自动抓取音轨。
- 选参数、点运行。给任务选好任务类型、语言、模型档位和导出格式,按"运行",文件就进入队列开始处理。任务进队列后主界面的状态列实时更新,多个文件排队依次处理,不用一直守着。
- 看结果。状态变成"完成"后双击该行,打开转录窗口。逐句带时间戳的文字可以直接查看和复制,也可以按之前勾选的格式导出文件。
跟做一次真实任务:90 分钟访谈变成带字幕的稿子
拿一份 90 分钟的中文访谈录音走一遍完整流程,四个核心参数都在这一步里。
导入文件后,任务类型选"转录":输出与录音同语言的原文。如果选"翻译",Buzz 会把非英语内容直接转成英文文本。这次要保留原话,所以选转录。
语言建议手动指定成中文,而不是自动检测。自动检测靠开头几秒猜语言,口音重或混音时容易跑偏,官方文档也明确推荐在已知语言时手动选择。
模型档位从 Tiny 到 Large 分五档,越大越准也越慢。90 分钟的访谈算重要素材,有独立显卡就选 small 或 medium;只有核显的话,small 配 Whisper.cpp 后端更稳。
导出格式勾选 TXT 和 SRT 两项:TXT 留纯文字稿,SRT 用来挂字幕。顺手把"词级时间戳"打开,后面的字幕整形功能才能解锁全部选项。
按运行,等进度条走完,双击任务行,逐句带时间戳的稿子就出来了,SRT 字幕文件也一并生成,可以直接导入剪辑软件。结果窗口自带搜索、播放控制和倍速功能,长稿校对比对着原始文件逐句听要省劲。
三种进阶能力:自动生成字幕与实时转写
字幕整形(Resize)。长录音导出的字幕行长短不一,有的观众看不完,有的跳得太碎,这时打开结果窗口点"Resize",设定每行最大长度,再选按标点拆分、按静音间隔合并或强制分块。得到的是一套行长统一的 SRT,适配不同平台的字幕规范基本只是改几个数字。
麦克风实时转录。会议、课堂、直播这类"边说边要出字"的场景,选录音任务、语言和麦克风,点"录制"即可。说话的同时文字实时出现在屏幕上,还能打开演示窗口把内容投到大屏展示。停录之后,文稿可以导出保存。
说话人识别。多人对话的录音需要分清谁说了什么时,打开结果窗口点"识别说话人"。Buzz 自动给每位发言者的句子打标签,你可以试听 10 秒样本、把自动标签改成真实姓名,还能把同一人的连续发言合并成整段。
把重复劳动交给程序
按自动化程度从低到高分三级。
一级:文件夹监控。在偏好设置里指定一个监控文件夹,之后新音频丢进去就自动开始转录,全程不用动手。定期更新的播客、成批堆积的课程录音最适合这个模式,程序在后台默默干活。
二级:插件。在"帮助 → 插件"里按需开关:AI 摘要自动提炼内容、Resize Transcript 转完自动做字幕整形、跳过已转录避免重复计算、增强语言检测提升多语混排准确率、导出 DOCX 直接出 Word 文档,完整列表见插件说明。涉及外部 API 的插件要填 key,其余都是纯本地运行;插件还能拖拽排序,按自己的流水线拼装。
三级:命令行。批量任务和定时脚本走 CLI,一条命令把参数定死,完整参数可查CLI 文档:
buzz add --task transcribe --language zh --model-type whispercpp --model-size small --srt interview.mp3挂到系统计划任务里,每天的新录音转完自己导出字幕,人不用盯着。
模型和硬件怎么选
作为一台 Whisper 本地工具,Buzz 的档位逻辑很简单:硬件决定上限,场景决定档位。
| 硬件环境 | 推荐档位 | 理由 |
|---|---|---|
| NVIDIA 显卡(显存 6GB 以上) | medium 或 large,配 CUDA 加速 | 精度上限最高,长音频也扛得住 |
| Apple Silicon 或核显 | small,用 Whisper.cpp 后端 | 优化到位,普通笔记本也能实时转写 |
| 纯 CPU 老机器 | tiny 或 base | 先保速度,重要文件换大模型再重跑 |
档位和后端在每个任务上都能单独改,不必全局锁定。两个附带建议:录音里有人名、地名或专业术语时,把它们填进高级设置的"初始提示词",这些词的识别率会明显上升;音源嘈杂就先勾"提取语音",让人声先被分离出来再转,准确度好一截。
快速答疑
问:完全断网的环境能用吗?能。模型首次使用需要联网下载一次,之后的转录全部在本机完成。电脑本身不能上网的话,在另一台机器上下好模型,把模型文件夹拷过去就行。
问:中文之外的语言效果如何?Whisper 原生支持 99 种以上语言,中英日德法都在列,转录和翻译都覆盖。多语混排的素材建议手动指定语言,比自动检测稳。
问:一小时录音要转多久?取决于模型大小和硬件,带 GPU 的机器上通常能达到实时甚至更快。觉得慢就降一档模型,或换 Whisper.cpp 后端再试。
问:特别长的音频能处理吗?没有硬性上限,几小时的录音直接丢进去就行。文件特别长时建议开词级时间戳,配合字幕整形后续更好改。
问:能转电脑正在播放的声音吗?可以。装一个虚拟音频设备(macOS 用 BlackHole、Windows 用 VB Cable),把系统声音指过去,再在 Buzz 里选它当录制源。
去官方发布渠道下载对应系统的安装包,导入你手边第一段录音。进度条走完、字幕文件生成的那一刻,"录音转文字"这件事就在你机器上跑通了。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考