news 2026/9/6 15:10:34

Buzz 本地语音转文字指南:离线转写音频,一键导出字幕

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 本地语音转文字指南:离线转写音频,一键导出字幕

Buzz 本地语音转文字指南:离线转写音频,一键导出字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费开源的桌面语音转文字工具,它在你的电脑上本地运行 OpenAI 的 Whisper 模型,把音频、视频乃至在线视频链接转成带时间轴的文字,支持翻译并导出 TXT、SRT、VTT。读完这篇指南,你能独立完成一条完整任务流:装好 Buzz,把一段音频转写成文字,最后导出可用的 SRT 字幕。

✅ 30 秒自检:你的机器能不能跑

  • 系统:Mac(Intel 与 Apple Silicon)、Windows、Linux 都支持。
  • CPU 需支持 AVX2,非常老的机器会崩溃。
  • 联网只发生在首次下载模型时。之后完全断网可用;给隔离机用时,把模型缓存文件夹从别的电脑拷过来即可(Linux 下位于~/.cache/Buzz)。
  • 有 Nvidia 显卡可以加速;没有也没关系,CPU 能跑。

🖥️ 挑一种装法把它装上

按你的系统选一条路:

  • Windows 和 macOS:从项目发布页下载安装程序(.exe / .dmg)。Windows 是未签名程序,安装时弹出警告就选 More info → Run anyway。
  • Linux(Snap):
sudo snap install buzz

装完再授权密码存储服务:

sudo snap connect buzz:password-manager-service

Linux(Flatpak):

flatpak install flathub io.github.chidiwilliams.Buzz

Python 环境(需 Python 3.12,并先装好 ffmpeg):

pip install buzz-captions

启动程序:

python -m buzz

首次运行会提示下载所选模型,体积从几十 MB 到两百多 MB。这是一次性投入,下载完成后所有转写都在本地进行。

📂 把第一段音频丢进队列

  1. 在 File 菜单选 Import Media File(或按 Ctrl/Cmd + O),挑一个音频或视频文件;想转在线视频也可以直接粘贴链接。
  2. 选任务类型:Transcribe 或 Translate;语言建议手动指定,比自动检测稳。
  3. 选模型和档位,点 Run。任务列表里能看到排队、处理中、已完成的实时状态。
  4. 状态变成 Completed 后,双击这一行打开转录详情。

一次丢几十个文件没问题,关掉窗口任务也会在后台继续跑完。

🎚️ 给模型选对档位

模型大小是速度与准确率的调节旋钮:

模型速度准确率推荐用法
Tiny最快一般快速试听、实时转写
Base尚可日常笔记
Small中等良好会议纪要初稿
Medium较慢很高重要内容精转
Large最慢最高字幕交付

我的建议直接给:粗转用 Base 就够,交付级字幕一步到位上 Large。

后端(Whisper 类型)决定用哪套引擎跑模型:

后端选它的理由
Whisper(OpenAI 原版)精确但慢、吃内存,除非需要兼容性否则不推荐
Faster Whisper有 6GB 以上显存的 Nvidia 卡选它,快一个量级
Whisper.cpp没有 Nvidia 卡、Mac、纯 CPU 选它,核显也能实时转写
HuggingFace想用针对特定语言优化的社区模型时选它

两个容易漏的选项:

  • Linux 上 Nvidia 显卡开箱即用 GPU 加速,Large 模型速度会快好几倍。
  • Advanced 里的 Initial prompt 可以写人名、专业术语,能明显减少拼错。

模型的下载、删除都在这页完成;Whisper.cpp 还支持粘贴一个 .bin 文件的下载链接,用第三方定制模型。

📄 把转写结果变成能用的交付物

双击已完成的任务进入转录视图,这是一个迷你字幕编辑器:

  • 每段文字带起止时间戳,点任意片段跳到对应音频位置。
  • 边播放边改文本,改动自动保存;播放速度 0.5 倍到 2 倍可调,方向键加 Ctrl 能按 0.5 秒微调片段时间。
  • Ctrl+F 全文搜索,逐条跳转匹配。

做字幕还要走一步 Resize:在转录视图点 Resize,设一个字幕最大长度,长句会按标点拆开;音频里若有静音分析还会帮你合并过短的碎片(前提是导入时开了 word-level timings 选项)。调好后从导出菜单选 SRT 丢进剪辑软件,TXT 当文字笔记,VTT 用于网页,各取所需。

🚀 进阶场景与常见卡点

三个现在就能用的场景:

  • 麦克风实时转写:用 Whisper.cpp 加小模型点 Record,边说边出字,还能开演示窗口在会议现场投出来。
  • 文件夹监控:指定监控目录,新音频一放进去自动开转,适合丢进共享文件夹的团队协作。
  • 说话人识别:多人访谈自动标注说话人,可改成真实姓名,还能合并同一人的连续句子。
  • 命令行批处理
buzz add --task transcribe --model-type whispercpp --model-size small --srt /path/to/audio.mp4

一条命令直接产出 SRT,跳过图形界面,写进脚本就是自动化流水线。

卡点速查:

  • 转得太慢:先降一档模型,再考虑 GPU 加速,别开太多并行任务。
  • 准确率差:录音先保清晰,再换 Large 重跑;手动指定语言优于自动检测。
  • 崩溃:多为模型下载不完整,去 Models 设置页删掉重下。
  • 任务一直排队:多半是模型还没下好,先回 Models 页确认。

最小起步动作:挑一段你手头的录音,按系统装上 Buzz,丢进队列用 Base 跑一遍,你会拿到一份能直接交付的 SRT。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 15:08:13

基于DeepSeek的多模态知识图谱Pipeline构建实战

简介:DeepSeek多模态实战:文本生成知识图谱构建的完整Pipeline设计是一份面向AI工程师、算法学习者及知识图谱从业者的技术文档,核心聚焦于如何把多模态数据转化为高质量文本,并同步构建、更新知识图谱。文档从DeepSeek基础概念讲…

作者头像 李华
网站建设 2026/9/6 15:04:00

Linux基础命令实战指南:从文件操作到系统排查

简介:Linux 零基础用户的首选手册《Linux 基础命令大全:新手上手指南》以完全面向初学者的视角,系统覆盖 Shell 入门、文件与目录操作、文本处理、权限与用户组管理、进程管理、系统信息与监控、网络管理、包管理、压缩与归档、用户环境与 Sh…

作者头像 李华
网站建设 2026/9/6 15:03:04

IT运维系统验收报告:从数据到证据链的完整指南

简介:案例型信息技术运维系统项目验收报告,依据ITIL最佳实践整理,适合IT运维人员、项目经理及信息化部门在项目验收阶段参照使用。文档以某总部信息技术综合运维管理平台建设项目为背景,完整覆盖验收申请、验收指标、配置统计、交…

作者头像 李华
网站建设 2026/9/6 15:02:24

SAP开发实战:用ABAP OLE实现Excel报表导出与格式控制

简介:这是一份面向SAP开发者的ABAP-OLE自动化技术PDF汇编,围绕ABAP作为客户端控制支持OLE的Windows桌面应用程序(如Microsoft Office)展开,适合需要自动生成Excel报表、处理Word文档、执行外部数据计算与导入导出的项目…

作者头像 李华
网站建设 2026/9/6 15:00:34

STM32 4-20mA电流环输出电路设计:方案、参数与避坑指南

简介:针对STM32在工业自动化中的4-20mA模拟量输出需求,这份资料以STM32内置DAC为基础,围绕TL431精密稳压、OPA333运放压控恒流源和外围电阻电容配置,讲清从DAC电压到4-20mA电流的完整电路与设计要点,适合有单片机基础、…

作者头像 李华