Buzz + Faster-Whisper 离线语音转写配置:数小时会议录音当天出文字稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
下午六点半,会议室里躺着一段四小时的讨论录音,文字稿今天必须交出去,而这台机器接不了外网。Buzz 解决的正是这类问题:它是跑在自己电脑上的离线语音转写工具,配合 Faster-Whisper 引擎,从音频到带时间戳的文字稿全程不需要联网。
Faster-Whisper 是对 OpenAI Whisper 的优化移植,精度与原版基本持平,转录速度却快出 2~4 倍,内存占用也更低。纯离线场景下,它基本是首选引擎;Buzz 的 buzz/transcriber/ 目录里还集成了 Whisper.cpp 等引擎,后文只围绕 Faster-Whisper 展开。
在本地跑起来 Buzz 之前要准备什么
硬件上,CPU 需要支持 AVX2,太老的机器带不动;有 NVIDIA 显卡的话转录会快不少,但没有也能用 CPU 跑。第一次下载模型需要联网,之后可以完全离线。
克隆仓库、建虚拟环境、装依赖,全部命令集中在下面:
git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz python -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install -e . pip install faster-whisper python main.py需要在一台能联网的电脑上提前把模型备好、再整包搬到离线机器的话,仓库里的 scripts/download-models.py 就是干这个的:它把模型缓存拉全,整个缓存文件夹拷到目标机器相同位置即可。
三步完成首次离线转录
打开偏好设置:菜单栏 Help -> Preferences,切到 Models 页。
下载模型:Group 下拉选 "Faster Whisper",尺寸先挑 Medium,点 Download。进度条走完后再点 "Show file location",确认文件落盘。模型统一存在用户缓存目录下,Linux 上就是~/.cache/Buzz/models,Medium 大约要 1.5GB 磁盘。
导入音频并转写:点主界面左上角的 "+",选中录音文件;在弹窗里核对 Model(刚才下的 Faster-Whisper 模型)、Language(音频语种)、Task(Transcribe 转录或 Translate 翻译),点 OK。任务进入队列,进度直接显示在主列表里,跑完点开任务就能看到逐句带时间戳的文字。
Faster-Whisper 模型尺寸怎么选
四个常用档位对比如下,体积按下载量估算:
| 模型 | 下载体积 | 转录速度 | 精度 | 适合场景 |
|---|---|---|---|---|
| Tiny | 约 75MB | 最快 | 一般 | 草稿速览、低配老机器 |
| Base | 约 140MB | 快 | 尚可 | 日常零散录音 |
| Medium | 约 1.5GB | 中等 | 高 | 默认推荐,会议记录、播客 |
| Large (v3) | 约 2.9GB | 最慢 | 最高 | 正式存档、专业交付 |
默认推荐从 Medium 起步:速度可接受,精度对多数会议和访谈够用。追求极致速度时可以看 large-v3-turbo(约 1.6GB),它在速度和精度之间取平衡。名字带.en后缀的变体只支持英语,处理中文等语种时别选错。同一份录音,不同档位效果差异明显,拿几分钟音频各测一遍是最稳妥的办法。
CPU 与 GPU 两条提速路径
CPU 路径:Buzz 默认只占用一半 CPU 核心做转录线程,无需改动。如果机器同时挂着别的重任务,或 GPU 驱动反复出问题,就在 Preferences 里勾选 Force CPU 强制走 CPU;显存或内存紧张时,再勾上 Reduce GPU memory,Buzz 会切到 int8 量化,内存占用明显下降,CPU 模式下同样有效。启动器层面等价的环境变量写法:
BUZZ_FORCE_CPU=true python main.py # 强制 CPU 转录 BUZZ_REDUCE_GPU_MEMORY=true python main.py # int8 量化,降低内存占用GPU 路径:NVIDIA 显卡 + CUDA 12 即可,Linux 上开箱即用,Windows 官方安装包已内置 GPU 支持。显存建议 6GB 起步;显存不够时开 Reduce GPU memory 量化(GPU 下为 int8_float16)即可放下 Medium 甚至 Large。
排障速查
| 现象 | 可能原因 | 处理 |
|---|---|---|
| 模型下载卡住或失败 | 网络不稳;Windows 并行下载锁竞争 | 重新下载;或联网机上备好文件后手动拷入 models 缓存目录 |
| 转完模型后 Buzz 崩溃 | 下载不完整或文件损坏 | 在 Preferences -> Models 里删除该模型重新下载 |
| 转录明显偏慢 | 模型偏大、后台程序抢占资源、GPU 未生效 | 换小一档模型;关闭占用大的程序;确认 CUDA 12 装好或改用 Force CPU |
| 有显卡却按 CPU 速度跑 | CUDA 版本低于 12,或驱动缺失 | 升级 CUDA 12;仍不行就勾 Force CPU 保底 |
| 文字对不上录音 | 模型档位太低、环境嘈杂 | 换更大模型;录音环境降噪;录完可再开降噪后处理 |
| 提示无法运行 Buzz | CPU 不支持 AVX2 | 更换较新的硬件,老平台不在支持范围 |
更多细节可以翻 docs/ 下的中英文档;想动手看引擎怎么调度转录,从 buzz/transcriber/ 和 buzz/widgets/ 两个目录读起,代码量不大,一天能过完。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考