Buzz:免费离线语音转文字工具,Whisper 转录全程本地完成
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费的离线语音转文字工具,基于 OpenAI Whisper,在你自己的电脑上完成音频转录与翻译,全程无需联网。整理会议录音时,谁不想不上传音频就能出文字稿?在线转录服务按量收费,隐私也没底。Buzz 把处理全部留在本地,音频文件永远不会离开你的设备。
它能做什么 🔍
- 99 种以上语言本地转录:中文、英文、日文等语言开箱可用,装好模型后完全离线运行。
- 转录和翻译一次完成:转写的同时可生成译文,比如英文采访直接产出中文文稿。
- 导出格式现成可用:支持 TXT、SRT、VTT,SRT 可直接用于视频字幕。
- GPU 加速:NVIDIA 显卡用 CUDA,AMD/Intel 显卡用 Vulkan,长音频处理速度明显提升。
快速上手 ⚡
- 安装:Windows 下载安装包直接运行(未签名,安装时点"仍要运行"即可);macOS 执行
brew install --cask buzz;Linux 用 Flatpak 或 Snap:
flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz导入:把音频或视频拖进主界面。支持 MP3、WAV、M4A、OGG、FLAC 等音频,以及 MP4、MKV、MOV、AVI 等视频,视频会自动提取音频。
出结果:选好模型和语言,点运行;完成后双击任务打开查看器,即可编辑并导出 TXT、SRT 或 VTT。
核心功能 🎧
- 实时录音转录:边录音边出文字,发言时就能看到文稿雏形;适合现场会议和访谈,结束后立刻核对要点。
- 文件夹监视:指定一个文件夹,新放入的音频自动排队转录;当天的采访录音丢进去,下班回来全是文本。
- 说话人识别:多人对话自动区分并标注说话人;两人对谈能直接分出各自说了什么。
- 模型档位可选:从 Tiny 到 Large 多档模型,低配机器跑 Tiny 求快,重要内容用大模型求准。
- 字幕长度调整:把过长段落切分成长度合适的字幕条,导出 SRT 后可直接导入剪辑软件。
转录核心逻辑在 file_transcriber.py,录音模式实现在 recording_transcriber.py,想改行为可以从这两处入手。
真实场景 📝
记者做采访:录音过程中开启实时转录,现场就能得到文字草稿。回发稿前在查看器里逐段核对人名和数字。注意专业词汇多时,在初始提示里写上相关术语,识别会更准。
视频创作者做字幕:导入视频后自动提取音频并生成带时间戳的字幕。用字幕调整功能控制单条长度,再导出 SRT。注意先选对语言,避免自动检测把中英混说判错。
研究生整理讲座:把多场讲座录音集中放进监视文件夹,批量转成文本后检索关键词。注意讲座时长较长时选大模型,等待时间换准确率。
企业会议纪要:例会录音统一归档到一个目录,Buzz 自动转录并区分说话人。注意会后先扫一遍译文或原稿,专有名词以人工修正为准。
效率技巧与常见问题 💡
三个小技巧:
- 手动指定语言,比自动检测稳,准确率提升明显。
- 日常内容用 Base 档模型即可,速度和准确度的平衡点最合适;重要录音再切 Large。
- 在偏好设置里统一管理模型,下载和删除都在界面里完成,不用手动管文件。
高频问题:
Q:识别不准怎么办?A:换更高档位的模型,手动指定语言,并尽量降低录音时的背景噪音。
Q:转录太慢怎么提速?A:在偏好中确认已启用 CUDA 或 Vulkan 加速;硬件一般时改用更小的模型。
Q:支持哪些文件格式?A:MP3、WAV、M4A、OGG、FLAC 等音频,以及 MP4、MKV、AVI、MOV 等视频均可导入。
Buzz 的价值在于把语音转文字变成不联网、不上传、不收费的本地操作,文稿随时可改、格式随时可导出。下载后先挑一段手头的会议录音或采访音频转一次,体验完速度和准确度,再决定是否启用文件夹监视做自动化。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考