news 2026/9/7 8:04:58

Buzz|离线转录与语音转文字——3 分钟从音频到字幕,数据零上传

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz|离线转录与语音转文字——3 分钟从音频到字幕,数据零上传

Buzz|离线转录与语音转文字——3 分钟从音频到字幕,数据零上传

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

2 小时会议录音还躺在手机里,Buzz 在本地帮你转成文字

开完 2 小时会,录音还在手机里躺着,谁也不想再手动敲一遍。Buzz 是一个离线转录和语音转文字工具:音频、视频文件直接在你的电脑上处理,由 Whisper(OpenAI 的语音识别模型)把声音变成文字。全程不上传,隐私敏感的会议录音也能放心丢进去。

从音频到字幕文件,Buzz 能做什么

批量文件转录:视频直接当音频用

音频、视频都能导入,视频会自动提取音轨处理。一次拖入多个文件,每个文件生成独立任务排队执行,主界面一眼看到谁在跑、谁完成。

实时录音转录:边说边出文字

接上麦克风选"实时录音"模式,Buzz 默认按 20 秒一段做转录,窗口里实时滚出文字。讲座、访谈、晨会结束就能拿走文字稿,不用事后听录音。

4 种 Whisper 后端:按你的硬件挑

  • Whisper 原版:最稳的基础实现
  • Whisper.cpp:轻量 C++ 实现,支持 Vulkan GPU 加速
  • Faster Whisper:针对转录速度优化
  • Hugging Face 模型:社区上传的各种优化模型

模型从 Tiny 到 Large-v3 都有,小设备跑小模型,好显卡跑大模型。

内置翻译与说话人分离

转录完可一键翻译成其他语言,适合跨国会议和外语材料。开启说话人识别后,多人对话会按发言人分段,会议纪要不用再猜哪句是谁说的。

时间戳编辑,导出 3 种字幕格式

TXT、SRT、VTT 三种格式直接导出,SRT 和 VTT 可导入视频剪辑软件。每段文字都能改开始/结束时间、拆分或合并段落,安静环境下准确率可达 95%+,人工校对量很少。

三步跑通:安装命令与导出第一份 SRT

第一步,准备:一条命令装好

  • Windows:下载安装包,安全警告选"更多信息"→"仍要运行"
  • macOS:brew install --cask buzz
  • Linux:flatpak install flathub io.github.chidiwilliams.Buzz
  • 开发者:pip install buzz-captions,再运行python -m buzz(需 Python 3.12)

第二步,操作:导入并运行

  1. 打开 Buzz,按Ctrl+O导入音频文件(也可直接拖入)
  2. 选好语言和模型质量;知道音频语言就手动选,准确率更高
  3. 点"运行",任务开始排队处理

第三步,拿结果:双击查看,导出字幕

转录完成后双击任务行,打开转录查看器,每段文字都带开始/结束时间。底部播放器可以边听边定位;"导出"菜单里保存为 SRT 即可。

四个高频场景,照着做就行

会议记录:说话人分离代替手动整理

产品或运营团队会后导入录音,开说话人识别,Buzz 把不同人的话分开放。你只做校对和删废话,不用逐句听录。

视频字幕:一条 MP4 直接出 SRT

创作者导入视频文件,Buzz 提取音轨转录,导出 SRT/VTT 拖进剪辑软件。时间戳不准的段落手动微调一下即可上线。

外语学习:播客原文配着听

学外语的人导入外语播客或课程音频,转录后对照原文听发音、查语法。Buzz 支持 99 种语言,冷门语种也有覆盖。

播客整理:长节目变可检索文字

播客主理人把单集转成文字,按时间戳快速定位某个话题,剪出金句做预告或博客素材,比拖进度条找快得多。

调优与排错:速度、准确率、格式、批量

转录速度慢

  • 换小模型:老机器用 Tiny 或 Base,速度立竿见影
  • 开 GPU 加速:Whisper.cpp 后端走 Vulkan,Faster Whisper 走 NVIDIA 驱动
  • 关掉其他吃 CPU 的程序,别和渲染任务抢资源

设备与模型对照:

你的设备推荐模型
老笔记本 / 无独显Tiny、Base
中端 PCSmall、Medium
M 系列 Mac 或 N 卡Medium、Large-v3

准确率不够

  • 换更大的模型,Medium 起步
  • 手动指定语言,别让它猜
  • 专业术语多的内容,在高级设置里加"初始提示",把术语写进去
  • 录音环境降噪,能用外接麦克风就别用耳麦

格式不识别

  • MP3、WAV、FLAC、OGG、MP4、MKV 等常见格式开箱即用
  • 冷门格式先转成 MP3 再导入,避免解码报错
  • 视频文件确认音轨存在,纯静音轨道没有内容可转

批量处理

  • 一次导入多个文件,自动各建一个任务
  • 队列顺序执行,每行显示进度和耗时
  • 支持从 URL 导入在线音视频,省一步手动下载

给开发者

Buzz 采用 MIT 许可证,基于 Python + PyQt 构建。核心代码在buzz/transcriber/(多后端转录逻辑)和buzz/widgets/(界面组件),buzz/plugins/是扩展插件系统,buzz/db/用 SQLite 存转录历史。想参与贡献,先看 安装文档,再到项目仓库提 Issue 或 PR 即可。

Buzz 把 Whisper 完整搬进本地:零订阅、不上传、离线可跑。打开应用,按Ctrl+O拖入第一段录音,几分钟后你会拿到一份带时间戳的字幕文件。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 8:03:15

腾讯云AI Skills实战:从零构建能干活的全能Agent

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 8:03:04

技术博文选题与内容匹配指南:从Spring Security到Python实践

这个项目标题属于言情小说/情感故事题材,与 CSDN 技术教程方向不匹配。我无法把它改写成一篇以代码、配置、排错和工程实践为核心的技术博文。如果你希望发布 CSDN 技术文章,可以换一个技术主题给我,例如:Spring Security 从入门到…

作者头像 李华
网站建设 2026/9/7 7:59:45

libxslt-1.1.32源码包手动编译实战:从configure到C语言集成

简介:libxslt-1.1.32.tar.gz 是基于 C 语言的 XSLT 转换库源码包,属于 Gnome 项目旗下的开源组件,面向需要在 Web 开发、数据交换、文档生成等场景中将 XML 转换为 HTML、PDF 或纯文本的开发者。压缩包共包含两千个文件,以 xsl、x…

作者头像 李华
网站建设 2026/9/7 7:59:33

C#基于U2NET与ONNX Runtime实现图片自动抠图

简介:面向C#开发者的无绿幕智能抠像资源包,以U2NET深度学习模型为核心,无需绿幕和手动参数调试,即可从复杂背景中自动分离前景目标。工程采用C#与Windows窗体实现,适合图像处理、人工智能应用开发者学习算法落地&#…

作者头像 李华
网站建设 2026/9/7 7:57:26

STM32 GPIO模拟I2C从机实现:中断状态机逐bit收发与踩坑指南

简介:这是一份面向STM32/GD32平台的模拟I2C从机通信Demo,使用纯C语言实现,适用于无硬件I2C外设、引脚受限或不想占用中断资源的单片机项目,也可用于I2C传感器、外部EEPROM等从设备逻辑的快速仿真。代码在50K通信速率下验证不丢包&…

作者头像 李华