news 2026/9/6 22:28:13

Buzz 离线语音转文字完整指南:10 分钟把声音文件变成能用的文稿

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线语音转文字完整指南:10 分钟把声音文件变成能用的文稿

Buzz 离线语音转文字完整指南:10 分钟把声音文件变成能用的文稿

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

想象你在做田野调查,一天访谈下来,电脑里堆满了录音文件。没有网,没有云端服务可传,文字稿却要当晚交出来。Buzz 离线语音转文字就是为这种时刻准备的:它把 OpenAI 的 Whisper 语音识别模型跑在你自己的电脑上,把音频、视频变成可搜索、可编辑、可导出的文字。不上传、不联网、不限时长,纯 CPU 就能跑,有显卡还能再快一截。

能力速览:一张表看懂 Buzz 能干什么

在动手之前,先给你一张地图。Buzz 本质上是一个转录引擎,给了你图形界面和命令行两个入口:界面负责"单个文件、实时录音",命令行负责"批量任务"。

能力能做什么适合谁
文件转录导入音频/视频(MP3、WAV、MP4、MOV…),本地转成文字所有人,起步功能
实时录音转录说话的同时生成文字,可开演示窗口投屏会议、演讲、直播字幕
翻译一键转成英文,或经 AI 翻译成任意语言外语内容整理者
批量与自动化命令行批量加任务、文件夹监控自动转录有几十上百个文件的人
转录加工双击改错、调时间戳、Resize 重组字幕行、导出 TXT/SRT/VTT/JSON做字幕、做文档的人
说话人识别区分录音里"谁说了什么",可改名、可合并访谈、会议记录
插件系统AI 摘要、降噪、导出 Word 等可扩展能力想定制流程的人

语言覆盖上,Whisper 模型自带约 99 种语言,中英文到拉脱维亚语都有。下面走一遍最短路径。

最短路径:第一次转出文字,只需 4 步

第 1 步:装好它。每个平台都有一条命令:

系统一条命令
Windowswinget install ChidiWilliams.Buzz
macOSbrew install --cask buzz
Linuxflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz

注意:Windows 安装包未做代码签名,安装时会弹安全警告。点"更多信息 → 仍要运行"即可,这是正常现象。

如果你是开发者想跑源码,克隆仓库https://gitcode.com/GitHub_Trending/buz/buzz后按 README 装依赖即可。

第 2 步:导入文件,只关心三个参数。菜单"文件 → 导入媒体文件"(Ctrl/Cmd + O)或工具栏"+"图标。弹窗里三个关键下拉框:

参数怎么选
Task"Transcribe"转成同语言文字;"Translate to English"直接翻成英文
Language知道什么语言就手动选,自动检测偶尔翻车,手动指定准确率更高
Model新手无脑选small,后面"长录音转太慢"一节细讲

第 3 步:点 Run。任务进队列,主界面显示实时进度。文件越大、模型越大越久,正常。

第 4 步:状态变 Completed 后,双击任务行。进入转录查看器:逐段带时间戳的文字,可以直接搜索、播放、改错,工具栏点"导出"就能拿到 TXT、SRT、VTT、JSON。第一份文字稿到手。

到这里你掌握了 Buzz 的 80%。剩下 20% 按你的实际问题对号入座。

长录音转得太慢,等不起?

转录质量的分水岭在模型,速度也是。Whisper 模型从小到大是tinybasesmallmediumlarge,每升一档更准,也更慢更吃内存:

你的情况推荐
低配电脑、看大意、实时录音tiny/base,秒级出结果
日常转录(多数人)small,速度和准确率的甜点区
口音重、术语多的专业录音medium/large,建议有显卡
内存吃紧想跑大模型Whisper.cpp 的量化版如q_5,微小精度损失换速度

后端(whisper type)也有讲究:没有 N 卡或 Mac 用户选 Whisper.cpp,C++ 实现,纯 CPU 也能跑实时转录;N 卡显存 ≥ 6GB 选 Faster Whisper,比原版快一个量级;还想试多语种定制模型(Meta MMS 等),用 HuggingFace 后端。

模型在"偏好设置(Ctrl/Cmd + ,)→ Models"页管理:左边已下载,右边待下载,勾选点 Download 即可,还能粘贴自定义模型的.bin下载地址,提前把常用模型拉好。

两个加速细节:N 卡用户在偏好里确认 CUDA 选项已启用,large的转录时间能从小时级降到分钟级;如果显卡老、反而拖后腿,设环境变量BUZZ_FORCE_CPU=true强制纯 CPU。国内下载模型慢,就设HF_ENDPOINT=https://hf-mirror.com走镜像。

开会、演讲要现场出字?

主界面切到 Live Recording 标签页,选麦克风、语言、模型,点红色 Record,说话的同时文字一行行出来。

注意:实时转录吃性能,官方明确建议用Whisper.cpp 后端 +tinybase小模型,默认 Whisper 模型跟不上语速。

三个让现场更好用的开关:

  • Append and correct 模式(偏好设置里的录制模式):会回头修正前面刚生成的句子,更准但更吃硬件;
  • 演示窗口(Presentation Window):录音开始后出现新选项,把实时字幕投到外接屏,做演讲字幕、直播辅助很顺手;
  • 实时转录导出到文本文件:打开后文字边生成边写入.txt,直接接 OBS 做直播字幕。

想转的不是话筒而是电脑里放出来的声音(网课、会议软件)?装一个虚拟声卡把系统输出改道:Windows 用 VB-CABLE,把系统输出设成 "CABLE Input",Buzz 里麦克风选 "CABLE Output";macOS 用 BlackHole 建多输出设备;Linux 用pavucontrol重定向。官方文档 docs/docs/usage/2_live_recording.md 有逐步图解。

外语音频,要的是"我能懂的语言"

翻译有两条路,一条离线、一条任意语言:

  • Translate to English:任务类型直接选它,任何语言的音频离线转出英文稿,这是 Whisper 自带能力,零配置;
  • 任意目标语言:偏好设置里填一个 OpenAI 兼容的 API 地址和密钥,在转录查看器点"Translate",给 AI 一句指令(例如"你是专业译者,把英文翻成西班牙语,只翻译、不加注释")。本地跑 Ollama、LM Studio 的兼容模型也能接上,等于搭一条全离线翻译管线。

提示:约 1 小时音频用云端模型翻译成本在 1 美元量级;想完全免费,把翻译模型也跑在本地。

字幕断句不自然,一行长到离谱?

这是转录后最常见的返工。解法是两件事配合:

  1. 转录时就勾选"Word-Level Timings(词级时间戳)"——事后无法补,这一步决定后面能不能用 Resize;
  2. 查看器工具栏点Resize:设字幕最大长度、按标点分割、按静音间隙合并,一键把碎词重组成规整的字幕行。

顺手记下几个快捷键,校对效率翻倍:Ctrl/Cmd + P播放/暂停,Ctrl/Cmd + ←/→微调当前段开始时间,Ctrl/Cmd + Shift + ←/→调整结束时间。双击文本单元格直接改字,改完自动保存。

一个文件夹几十个音频,不想一个个点?

图形界面之外还有命令行入口。buzz add一次丢多个文件,参数按需求加:

buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈1.mp3 访谈2.wav

这条命令用 Whisper.cpp 的 small 模型转录两个文件,并直接输出 SRT 和 VTT 字幕。常用参数:--language zh指定语言,--prompt "专有名词提示"减少错字,--task translate做翻译。配合系统定时任务,夜里跑一个文件夹,早上起来直接收稿;详细参数见 docs/docs/cli.md。

再往上还有两层自动化:文件夹监控(偏好设置里开一个目录,新文件落进去自动转录);Skip Already Transcribed 插件(重导文件夹时跳过已转过的,不重复烧算力)。

另外,访谈录音里分不清谁说的谁?查看器里点"Identify speakers",Buzz 会把不同说话人的句子标上标签,你能试听 10 秒原声、把标签改成真人姓名,保存时还能勾选把同一人的连续句子合并成段。

只记一张表:你的情况怎么选

如果你是…就这样配
老笔记本 / 没有显卡Whisper.cpp 后端 +small,量化版q_5再省内存
N 卡且显存 ≥ 6GBFaster Whisper +medium/large,开 CUDA
要实时录音出字Whisper.cpp +tiny/base,别用默认后端
要中文以外语言的翻译本地 Ollama / LM Studio 接上,全离线
文件多、要重复跑命令行buzz add+ 文件夹监控 + 跳过已转插件
涉密、完全不能联网在别的机器下好模型,拷到本机模型目录,离线可用

回到开头:现在就把那段录音变成稿子

回到开头那个山村访谈的场景——其实不需要走到山里,你手头现在就有一段"转不动"的录音:客户电话、外语课、采访现场。打开 Buzz,导入它,手动选好语言,模型选small,点 Run。等状态变成 Completed,双击,导出。你拥有的不再是一段再也听不全的录音,而是能搜索、能编辑、能导出的文字资产。

觉得顺手,去项目仓库点个 Star,遇到的问题和想法也欢迎反馈给社区。Buzz 的文件夹监控、更多语言模型、AI 摘要等能力还在持续迭代,这套本地转录工作流,值得成为你工具箱里的常驻成员。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 22:27:33

CSSBB备考攻略:如何高效使用Primer吃透六西格玛黑带考试

简介:一份由 Quality Council of Indiana 出版的六西格玛黑带经典入门资料(CSSBB Primer),适合六西格玛黑带认证考生、质量管理专员与精益改善从业者阅读,用于系统掌握企业级六西格玛部署逻辑、领导力要求及统计改进工…

作者头像 李华
网站建设 2026/9/6 22:27:22

论文降重避坑指南:识别不可靠服务与建立高效修改流程

引言 毕业论文写作是每位学子必须跨越的重要关卡,而降重与文本改写往往是其中最具挑战性的环节之一。面对市场上琳琅满目的降重服务,如何辨别优劣、避免踩坑,成为许多同学关注的焦点。本文将系统梳理不可靠降重服务的典型特征,并…

作者头像 李华
网站建设 2026/9/6 22:27:11

WeKnora 本地部署全指南:5 分钟跑通离线 RAG 知识库

WeKnora 本地部署全指南:5 分钟跑通离线 RAG 知识库 【免费下载链接】WeKnora Open-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki. 项目地址: https://gitcode.com/Git…

作者头像 李华
网站建设 2026/9/6 22:22:52

SDS2000X超级荧光示波器实战:从探头补偿到纹波测量与远程控制

简介:SDS2000X系列超级荧光示波器数据手册完整收录该系列示波器的技术规格与核心应用特性,面向硬件调试、嵌入式开发、电子测量等场景的工程师和学习者,可作为选型对比、参数查阅和功能上手的重要参考。手册重点阐明300MHz最大带宽与2GSa/s采…

作者头像 李华
网站建设 2026/9/6 22:21:22

家用搬运机器人机械创新设计:从需求分析到样机验证全流程经验

简介:这份设计说明书为家用搬运机器人机械创新设计大赛参赛作品,面向机械设计、自动化等专业学生及机器人爱好者,完整呈现一款能自动识别垃圾、判定方向并完成收拾餐桌、倒垃圾等家务的机器人方案。文档围绕机械手、双摇杆机械臂、三伺服电机…

作者头像 李华