news 2026/9/7 4:32:11

Buzz 离线转录:3 步完成语音转文字,文件不出本地

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz 离线转录:3 步完成语音转文字,文件不出本地

Buzz 离线转录:3 步完成语音转文字,文件不出本地

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

会议录音结束,不必把音频上传云端排队处理:打开 Buzz,导入那个 MP3,几分钟后带时间戳的转录稿和译文就出现在屏幕上,全程没有离开这台电脑。Buzz 是一款基于 OpenAI Whisper(开源语音识别模型)的离线转录与翻译工具,在你自己的电脑上完成语音转文字和翻译。

项目速览

  • 定位:桌面端离线音频转录、翻译与字幕导出工具
  • 平台:Windows、macOS(Intel 与 Apple Silicon)、Linux(Flatpak / Snap)
  • 技术栈:Python 3.12 + PyQt6(跨平台图形界面框架),多种 Whisper 后端
  • 支持语言:约 99 种
  • 导出格式:TXT、SRT、VTT
  • 许可证:MIT,可自由使用与修改

核心体验

🎧 导入文件,任务即建

把 MP3、MP4 拖进主界面,或点“导入媒体文件”,Buzz 会自动提取音频轨道并生成一条独立任务。在任务行里选定任务类型、语言和模型大小,点“运行”开始处理,多文件可一次添加、排队执行。

📝 按时间戳打开查看器逐段校对

任务完成后双击任务行进入转录查看器。点任一片段,音频从该时刻播放;拖动片段边界,让文字与语音重新对齐;搜索框输入关键词可直接跳转,片段还能拆分、合并或删除。

🎙️ 边说边转的实时录音

切到“实时录音”,选好麦克风和语言,按录音键即可。文字随着讲话流式出现,延迟默认 20 秒可调,避免同步错位。做演示或讲座时还能打开单独的展示窗口,把字幕投到第二块屏幕上。

能力拆解

按硬件挑后端

Buzz 内置多种 Whisper 实现,在“偏好设置”里切换,差异主要在速度、精度和资源占用:

后端适用场景
whisper(PyTorch 原版)最稳定,Nvidia GPU 有 CUDA 加速
whisper.cpp轻量,Vulkan(通用显卡的 GPU 加速)可跑集成显卡
faster-whisper偏重转录速度
Hugging Face 模型按模型 ID 使用社区发布的各类模型

每个后端内还能从 tiny 到 large 选模型尺寸:越小跑得越快,越大越准,代价是内存占用更高。

字幕级的后处理

转录完才是开始。Buzz 把结果当字幕轨来管:按字符数、时间间隔拆分,或按标点智能分段;每段的起止时间可手动微调,让节奏与语音贴合。最终导出 SRT、VTT 可直接进剪辑软件。长音频可先做语音分离(把人声从背景噪音中抽离)再转录,还能用说话人识别给片段标记不同的讲话者。

批量与自动化

“监听文件夹”指定一个目录后,新放进来的音频自动排队转录。命令行接口(用文本指令运行程序的方式)同样可用:一条buzz add可以传多个文件、指定后端、语言和导出格式,--hide-gui隐藏窗口便于塞进脚本,完整参数见 cli.md。

动手指南

3 步装好

  • macOS 下载 .dmg 安装;Windows 下载安装包,出现安全提示选“更多信息”再“仍要运行”
  • Linux 用 Flatpak:
flatpak install flathub io.github.chidiwilliams.Buzz
  • 开发者通道(需 ffmpeg 与 Python 3.12):
pip install buzz-captions python -m buzz

4 步跑通第一次转录

  1. 导入媒体文件(Ctrl/Cmd+O)。
  2. 在任务行选择任务(transcribe 转录 / translate 翻译)、语言和模型大小。
  3. 点“运行”,等进度条走完。
  4. 双击任务行查看结果,按需导出 SRT 或 TXT。

适用人群与边界

谁适合

  • 学生:课堂录音、外语播客转成可检索的文字,还能把原文直接译成能读懂的目标语言辅助学习。
  • 内容创作者:给视频批量出 SRT 字幕,或用监听文件夹把一整批播客音频排队处理。
  • 小团队:处理不便上传外部服务的内部会议录音,本地运行意味着数据不出内网。

不适用的场景

Buzz 的精度上限就是 Whisper 本身:环境嘈杂、多人抢话、口音较重时准确率都会下降,只能换更大的模型多等一会儿。几小时的长音频对内存和磁盘要求不低,首次下载模型文件也占空间。没有 Web 版,结果只能在处理机器上查看;Windows 安装包未签名,首次安装会弹警告,属正常现象。

进阶与生态

插件机制按目录组织:一个包含plugin.py的目录声明元数据与生命周期钩子,即可接入转录前后处理,官方已带 AI 摘要、自动字幕调整等插件,示例都在 plugins/。转录核心逻辑在 buzz/transcriber/,想改代码可直接克隆仓库:

git clone https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 能覆盖本机“音频变文字”的大部分场景。手上有待转录的文件时,装好用它跑一遍最小的文件试试即可,源码按上面的命令克隆下来就能读。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 4:31:01

ArcGIS Pro水文分析:从DEM到研究区图的完整制图流程

研究区图是水文、遥感、工程规划类项目里最常见的一类基础图件。它看起来只是把研究边界、水系、行政区和重要控制点叠在一张图上,真正做起来却涉及数据投影、地形分析、流域提取、地图整饰、规范导出等一长串流程。制作研究区图不能只靠在地图上手动描线&#xff0…

作者头像 李华
网站建设 2026/9/7 4:28:56

Unity PSD转UI自动化:ETYIUI实现预制体生成与代码绑定全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 4:28:50

技术博客写作指南:开源项目与本地部署的工程实践

抱歉,这个输入内容不适合改写成 CSDN 技术博客。任务标题看起来是一个社交网络上的 Meme 梗合集,没有开源项目信息、功能说明、部署方式或可验证的技术过程,不符合 CSDN 的领域定位,也不适合作为技术教程发布。如果你手头有本地部…

作者头像 李华
网站建设 2026/9/7 4:28:41

婚介客户管理系统与相亲小程序开发实战

你提供的主题是一则婚介广告文案,与 CSDN 技术博客的定位完全不匹配。CSDN 是面向开发者、软件工程师和科技从业者的技术社区,发布的核心内容是编程语言、框架、架构、人工智能、运维、数据库、工具链和工程实践等方向,帮助读者解决实际开发问…

作者头像 李华