Buzz离线语音转文字:免费本地转录,十分钟上手指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
你手头有一份两小时的访谈录音,交给云端转录服务要花钱,还担心录音泄露。Buzz 是一款免费、离线的语音转文字工具,基于 OpenAI Whisper 模型,在你自己的电脑上完成识别和翻译。音频文件全程不离开你的设备,这是它最核心的价值——敏感内容也能放心处理,而且没有任何按分钟计费。
先花30秒看它值不值得装
- 本地转录与翻译:所有计算在本地完成,适合处理机密会议、采访录音的人
- 多格式导出:SRT、TXT、VTT 一键导出,字幕制作和内容创作者省事
- 实时录音转录:说话的同时文字滚出来,适合会议记录、现场主持
- 说话人识别:自动区分多人对话的发言者,访谈和播客后期更清楚
- 插件扩展:AI 摘要、字幕自动切分,想一步到位的可以看 plugins/
十分钟把Buzz跑起来
最低成本的一条路径,按平台三选一:
brew install --cask buzz # macOS 用上面这条 flatpak install flathub io.github.chidiwilliams.Buzz # Linux # Windows:下载安装包双击运行即可- 打开偏好设置 → 模型,先下载 tiny 或 base 模型,文件小、低配电脑也跑得动。
- 把一段音频(比如 mp3)直接拖进主界面,选好模型和语言,点运行。
- 转录完成后双击任务,在查看器里核对文本、微调时间轴,然后导出。
这些功能最常用
- 文件转录| 适合批量处理的人:音频、视频甚至网页链接都能丢进去,自动提取音轨并带时间戳输出文字
- 实时录音转录| 适合讲演和主持:边说边出字,还能开个独立"演讲窗口"投到幕布上
- 说话人识别| 适合多人访谈:自动给不同发言者打标签,谁说了什么一目了然
- 文件夹监视| 适合每周都要整理会议的人:录音丢进指定文件夹,它自动转录,不用手动点
- GPU 加速| 适合赶时间的人:NVIDIA 走 CUDA,其他显卡走 Vulkan,Apple 芯片也能加速,长音频速度明显提升
谁在用它:三个真实用法
记者→ 整理两小时访谈 → 导入录音、手动选好中文、跑一遍大模型,再在查看器里改错字 → 下午就拿到接近成品的文字稿
字幕创作者→ 给视频加字幕 → 导入视频文件,导出 SRT,用字幕切分功能把过长的行缩短 → 字幕文件直接丢进剪辑软件
资料馆管理员→ 处理几十段讲座录音 → 打开文件夹监视,录音陆续丢进目录 → 不用守着,全部自动转完
和云端、命令行方案比
| 维度 | Buzz | 云端转录服务 | Whisper 命令行 |
|---|---|---|---|
| 隐私 | 本地运行,音频不上传 | 音频上传服务器 | 本地 |
| 费用 | 免费 | 按分钟收费 | 免费 |
| 实时录音 | 内置,开箱即用 | 基本不支持 | 需自己写脚本 |
| 上手门槛 | 图形界面,拖放即用 | 低 | 需配置命令行参数 |
一句话劝退:如果你的音频只有一两分钟、又不介意上传云端,云服务的速度和便利性通常更好,没必要专门装它。
常见坑与解决办法
问:转录太慢,等不了怎么办?换小一号的模型(tiny/base),或者开启 GPU 加速。没有独立显卡就选 Whisper.cpp 后端,核显甚至纯 CPU 也能跑。
问:模型选哪个?日常用 base 起步,重要内容用 large 系。模型都在偏好设置里集中管理,下错了可以删掉重下。
问:完全没网的环境能用吗?可以。在有网的电脑上下载好模型,把模型文件夹拷到离线电脑的 Buzz 缓存目录即可,详见 docs/docs/faq.md。
问:识别总出错?手动指定音频语言,别用自动检测;专业术语写进初始提示;模型再调大一档。
写在最后
Buzz 把离线转录、实时录音和多格式字幕导出装进一个免费桌面应用。去发布页下载最新版,丢进第一段录音试试,更多用法看官方文档 docs/。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考