news 2026/9/6 16:31:10

Buzz完整指南:5分钟跑通本地离线语音转文字,录音到SRT字幕一步到位

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz完整指南:5分钟跑通本地离线语音转文字,录音到SRT字幕一步到位

Buzz完整指南:5分钟跑通本地离线语音转文字,录音到SRT字幕一步到位

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

你有没有过这样的经历:把一段采访录音发给云端转录服务,之后反复担心它被拿去训练或外泄?开完40分钟的会,还要逐句听回音、手动敲纪要?Buzz是基于OpenAI Whisper的桌面工具,主打离线语音转文字——所有音频留在你自己的电脑里处理,直接给你带时间戳的文本和字幕。不用注册、不用上传,装完就能用。

手工敲字幕和云端转录,到底卡在哪

几个真实的场景,看看是不是你的日常:

  • 视频创作者剪片子:40分钟的vlog要配字幕,只能一边倒带一边手敲台词、对时间轴,一个下午就耗在字幕上
  • HR或法务整理访谈:录音里涉及候选人薪酬、当事人陈述,发给第三方在线平台心里不踏实,但逐字听写又太慢
  • 记者批量处理外访录音:一次出差回来十几条录音,按分钟计费的云端服务成本高,而且每个文件都要手动上传、下载
  • 做分享、发布会需要即时文字:在线转录工具要么要联网上传,要么延迟大,很难撑住现场

这些麻烦的共同点不在"能不能转",而在"音频必须离开你的设备,或你必须手动干最脏的活"。Buzz的思路是把这两件事同时干掉。

本地处理给你带来什么

  • 音频不落地到任何服务器:转录在你的CPU或GPU上完成,唯一需要联网的环节是首次下载模型
  • 转录和翻译二合一:同一个任务里既能转写成原文,也能翻译成目标语言,不用来回切工具
  • 字幕直接交付:导出SRT、VTT、TXT三种格式,字幕文件拿到视频软件里就能用
  • 批量与自动化:多文件排队处理,还可以开启文件夹监视,新录音落盘即自动转录
  • 可扩展:插件系统提供AI摘要、降噪、文档导出等能力,不用改代码就能叠加

Buzz功能全景:输入、处理、输出三层看

输入端——素材怎么进来

  • 本地音频/视频文件:MP3、WAV、FLAC、M4A、MP4、MKV等,视频会自动提取音轨
  • 网络链接:直接粘贴YouTube等URL导入
  • 麦克风实时录音:支持现场活动用的演示窗口,把实时文字投到另一块屏上

处理端——引擎怎么选

  • 多个Whisper后端:Whisper、Whisper.cpp、Faster Whisper、Hugging Face模型,以及OpenAI Whisper API
  • 硬件加速:Nvidia GPU走CUDA,多数独立/核显GPU走Vulkan,Mac用Apple Silicon原生跑
  • 语音分离:转录前先把人声从背景噪声里抽出来,嘈杂录音的准确率明显受益
  • 说话人识别:在转录结果里自动区分不同说话人,对话结构一目了然

输出端——结果怎么出去

  • 导出TXT、SRT、VTT,插件还能加DOCX
  • 转录查看器:逐段编辑、搜索、播放控制、倍速调节
  • 字幕调整工具:按间隙合并、按标点切分,控制每条字幕的时长

安装与首次运行:每个平台3步以内

Windows与macOS

  1. 到SourceForge的buzz-captions下载页拿对应安装包(Windows是exe,macOS是dmg)
  2. Windows因应用未签名会弹警告,点"更多信息"→"仍要运行"即可
  3. 打开应用,首次使用时下载一个模型,之后彻底离线

Linux

flatpak install flathub io.github.chidiwilliams.Buzz

或者用Snap:

sudo snap install buzz

Python环境安装

适合开发者:先装好ffmpeg,用Python 3.12环境,然后:

pip install buzz-captions python -m buzz

命令行首跑

Buzz自带CLI,一条命令就能完成"转录+导出SRT":

buzz add -m whispercpp -s small --srt --vtt ~/Downloads/meeting.mp4

常用参数:-t选任务(transcribe/translate)、-m选后端、-s选模型大小、-l指定语言、--txt/--srt/--vtt选导出格式。不指定语言时会自动检测。

界面走查:四个关键位置

任务管理主界面

  • 把音频或视频拖进来即可加入转录队列,也可以粘贴URL
  • 每个任务一行,状态、所用模型、进度一目了然
  • 支持多任务并行排队,长音频和大文件互不阻塞
  • 顶部工具栏覆盖导入、实时录音等高频操作

转录查看器

  • 文本按片段逐段展示,带时间戳,点击即可跳到对应音频位置
  • 支持全文搜索、播放控制和倍速调节
  • 每段文字可直接编辑,改完即保存
  • 导出菜单在这里,TXT、SRT、VTT按格式选

偏好设置与模型管理

  • 常规页可配API密钥、Base URL,以及默认导出文件名模板
  • 模板支持变量,比如按输入文件名、任务、日期自动拼出导出名
  • 实时转录有三种模式:追加在下方、追加在上方、追加并纠错

  • 在这里下载新模型、删除用不上的旧模型
  • 不同后端(Whisper、Whisper.cpp等)的模型分开管理
  • 磁盘空间紧张时优先清理不用的大模型

字幕调整工具

  • 针对导出的SRT/VTT做二次整形,不用重跑转录
  • 可按音频间隙合并过短的片段
  • 可按标点切分过长的字幕
  • 设置期望的每条字幕时长,自动对齐格式

源码地图:五个核心模块

  • 转录引擎目录:buzz/transcriber/ —— 文件转录、实时录音、Whisper.cpp、API等各类引擎实现
  • 转录查看器:buzz/widgets/transcription_viewer/ —— 查看、编辑、导出、说话人识别等界面组件
  • 实时录音界面:buzz/widgets/recording_transcriber_widget.py —— 麦克风采集与实时转录的UI逻辑
  • 文件夹监视:buzz/widgets/transcription_task_folder_watcher.py —— 监听目录并自动为新文件建转录任务
  • 命令行入口:buzz/cli.py ——buzz add命令的参数解析与任务创建

插件相关逻辑集中在buzz/plugins/,每个插件一个目录,写处理逻辑后由加载器注册进系统。

实战场景:三种角色各走一条工作流

视频创作者出字幕

  1. 拖入成片MP4,选Whisper.cpp small模型
  2. 勾选SRT导出,任务完成后拿到字幕文件
  3. 字幕直接导入剪辑软件,再用调整工具修整时长——一个下午的字幕活缩到一杯咖啡

记者现场整理采访

  1. 开启实时录音转录,打开演示窗口投屏
  2. 采访进行中就能看到文字稿雏形,漏问的问题当场补
  3. 结束后导出TXT,进入编辑环节

企业自动处理会议录音

  1. 配置文件夹监视指向会议录音归档目录
  2. 配好默认导出文件名模板
  3. 录音一落盘就自动出文字纪要,会后不用人催

进阶调优:模型怎么选、参数怎么加

模型大小对照(相对概念,非精确指标):

模型体积速度准确率适合场景
tiny最小最快基础实时转录、低配设备
base较小良好日常批量处理
small/medium中等中等良好到优秀正式稿件、访谈整理
large最大最佳关键会议、对准确率敏感的内容

常用进阶参数

  • -w生成词级时间戳,做逐字对齐时用
  • -e转录前做语音分离,噪声大的录音建议加上
  • -p给初始提示,把专有名词、术语提前告诉模型
  • -l zh手动指定语言,比自动检测更稳
  • 显存紧张时选Whisper.cpp后端开Vulkan,或勾选"Reduce GPU RAM"偏好

常见问题

支持哪些格式?音频走ffmpeg,MP3、WAV、FLAC、M4A、OGG等都行;视频如MP4、AVI、MOV、MKV会自动抽音轨。

必须联网吗?转录本身完全离线。只有首次下载模型(以及用OpenAI API后端做翻译时)需要网络。

能转中文吗?可以。语言列表覆盖百余种,含普通话,-l zh即可指定。

实时转录够快吗?官方提示该功能比较吃资源,可能达不到严格意义的实时,建议用较小的模型并留意硬件配置。

能写进脚本吗?能。CLI就是为自动化设计的,buzz add ... --hide-gui可以隐藏主窗口纯后台跑。

下一步做什么

Buzz把"音频出设备"这个最大的顾虑拿掉了,剩下的只是把流程跑顺。按下面四步走,今天就能用起来:

  1. 按你的系统装好Buzz,下载一个base或small模型
  2. 挑一段真实录音跑通"导入→转录→导出SRT"全流程
  3. 打开偏好设置,配好默认导出文件名模板和模型目录
  4. 开一个归档目录试跑文件夹监视,让新录音自动转成文字稿

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 16:31:07

程序员简历模板这样填,才能通过HR初筛和面试官筛选

简介:程序员软件开发设计类岗位求职简历模板,面向IT行业求职者与转岗人员,覆盖个人信息、自我评价、工作经历、技能水平、项目经历、优势特长等完整模块,可直接填写参考。模板以设计助理工作经历为例,展示了产品管理、…

作者头像 李华
网站建设 2026/9/6 16:29:52

基于深度学习的局部模糊识别:从数据构造到部署的完整复盘

简介:该资源为一篇深度学习方向的专业参考文献,聚焦数字图像局部模糊识别技术,面向图像取证、计算机视觉及信息安全领域的研究人员、工程师和高年级学生。文中针对图像篡改中常用的高斯模糊、均值模糊与中值模糊等操作,提出一种优…

作者头像 李华
网站建设 2026/9/6 16:27:29

猫抓如何用MPD解析下载DASH视频:完整指南

猫抓如何用MPD解析下载DASH视频:完整指南 【免费下载链接】cat-catch 猫抓 浏览器资源嗅探扩展 / cat-catch Browser Resource Sniffing Extension 项目地址: https://gitcode.com/GitHub_Trending/ca/cat-catch 猫抓 cat-catch 是一款浏览器资源嗅探扩展&am…

作者头像 李华
网站建设 2026/9/6 16:24:56

英语打字比中文还慢?这款免费键盘输入训练工具值得试试

英语打字比中文还慢?这款免费键盘输入训练工具值得试试 【免费下载链接】qwerty-learner 为键盘工作者设计的单词记忆与英语肌肉记忆锻炼软件 / Words learning and English muscle memory training software designed for keyboard workers 项目地址: https://gi…

作者头像 李华
网站建设 2026/9/6 16:24:08

电梯控制流程图全解读:状态机模型、调度算法与PLC实现

简介:这是一份面向电气自动化、楼宇智能化及电梯控制教学场景的PDF文档,系统讲解电梯控制流程图的核心知识点。内容涵盖电梯上下行流程、外呼响应流程、开关门控制流程三大模块,并给出最远反向呼梯响应、平层开关门延时等关键逻辑说明&#x…

作者头像 李华