news 2026/9/11 21:26:18

Buzz:免费离线语音转文字工具,Whisper 转录全程本地完成

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Buzz:免费离线语音转文字工具,Whisper 转录全程本地完成

Buzz:免费离线语音转文字工具,Whisper 转录全程本地完成

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费的离线语音转文字工具,基于 OpenAI Whisper,在你自己的电脑上完成音频转录与翻译,全程无需联网。整理会议录音时,谁不想不上传音频就能出文字稿?在线转录服务按量收费,隐私也没底。Buzz 把处理全部留在本地,音频文件永远不会离开你的设备。

它能做什么 🔍

  • 99 种以上语言本地转录:中文、英文、日文等语言开箱可用,装好模型后完全离线运行。
  • 转录和翻译一次完成:转写的同时可生成译文,比如英文采访直接产出中文文稿。
  • 导出格式现成可用:支持 TXT、SRT、VTT,SRT 可直接用于视频字幕。
  • GPU 加速:NVIDIA 显卡用 CUDA,AMD/Intel 显卡用 Vulkan,长音频处理速度明显提升。

快速上手 ⚡

  1. 安装:Windows 下载安装包直接运行(未签名,安装时点"仍要运行"即可);macOS 执行brew install --cask buzz;Linux 用 Flatpak 或 Snap:
flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz
  1. 导入:把音频或视频拖进主界面。支持 MP3、WAV、M4A、OGG、FLAC 等音频,以及 MP4、MKV、MOV、AVI 等视频,视频会自动提取音频。

  2. 出结果:选好模型和语言,点运行;完成后双击任务打开查看器,即可编辑并导出 TXT、SRT 或 VTT。

核心功能 🎧

  • 实时录音转录:边录音边出文字,发言时就能看到文稿雏形;适合现场会议和访谈,结束后立刻核对要点。
  • 文件夹监视:指定一个文件夹,新放入的音频自动排队转录;当天的采访录音丢进去,下班回来全是文本。
  • 说话人识别:多人对话自动区分并标注说话人;两人对谈能直接分出各自说了什么。
  • 模型档位可选:从 Tiny 到 Large 多档模型,低配机器跑 Tiny 求快,重要内容用大模型求准。
  • 字幕长度调整:把过长段落切分成长度合适的字幕条,导出 SRT 后可直接导入剪辑软件。

转录核心逻辑在 file_transcriber.py,录音模式实现在 recording_transcriber.py,想改行为可以从这两处入手。

真实场景 📝

记者做采访:录音过程中开启实时转录,现场就能得到文字草稿。回发稿前在查看器里逐段核对人名和数字。注意专业词汇多时,在初始提示里写上相关术语,识别会更准。

视频创作者做字幕:导入视频后自动提取音频并生成带时间戳的字幕。用字幕调整功能控制单条长度,再导出 SRT。注意先选对语言,避免自动检测把中英混说判错。

研究生整理讲座:把多场讲座录音集中放进监视文件夹,批量转成文本后检索关键词。注意讲座时长较长时选大模型,等待时间换准确率。

企业会议纪要:例会录音统一归档到一个目录,Buzz 自动转录并区分说话人。注意会后先扫一遍译文或原稿,专有名词以人工修正为准。

效率技巧与常见问题 💡

三个小技巧

  1. 手动指定语言,比自动检测稳,准确率提升明显。
  2. 日常内容用 Base 档模型即可,速度和准确度的平衡点最合适;重要录音再切 Large。
  3. 在偏好设置里统一管理模型,下载和删除都在界面里完成,不用手动管文件。

高频问题

Q:识别不准怎么办?A:换更高档位的模型,手动指定语言,并尽量降低录音时的背景噪音。

Q:转录太慢怎么提速?A:在偏好中确认已启用 CUDA 或 Vulkan 加速;硬件一般时改用更小的模型。

Q:支持哪些文件格式?A:MP3、WAV、M4A、OGG、FLAC 等音频,以及 MP4、MKV、AVI、MOV 等视频均可导入。

Buzz 的价值在于把语音转文字变成不联网、不上传、不收费的本地操作,文稿随时可改、格式随时可导出。下载后先挑一段手头的会议录音或采访音频转一次,体验完速度和准确度,再决定是否启用文件夹监视做自动化。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 10:49:56

测试时扩展与推理大模型评测:可复现性工程实践

最近在对比推理大模型(reasoning LLM)的不同评测方式时,被一个很现实的问题卡住:模型效果波动不小,同一个 prompt 跑两次,答案可能完全不同;换一个推理采样配置,分数能差好几个点。如…

作者头像 李华
网站建设 2026/9/2 6:17:54

具身大模型:从VLA到数据飞轮,机器人如何走向物理世界?

具身大模型正在成为 AI 赛道最热的名词之一,但它并不是一个靠 PPT 包装出来的概念。过去一年,从 Figure AI、Physical Intelligence 到国内的智元、宇树、银河通用等公司,具身智能领域的融资节奏明显加快。你可能已经看到过“一天投出 5 个亿…

作者头像 李华
网站建设 2026/9/2 16:08:27

一文讲清!深度解析 DeepSeek 的蒸馏技术,从核心原理到未来大战方向,收藏这一篇就够了!!

前言 DeepSeek的蒸馏技术更是这一领域的佼佼者,它不仅攻克了传统蒸馏的瓶颈,还在多模态数据处理等前沿领域取得了突破性进展。本文将深入剖析DeepSeek蒸馏技术的核心原理、创新策略以及未来发展方向,带你一探究竟,领略AI模型优化的…

作者头像 李华