news 2026/9/12 6:38:53

whisper.cpp 模型怎么选:3 步定下本地语音转文字方案

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
whisper.cpp 模型怎么选:3 步定下本地语音转文字方案

whisper.cpp 模型怎么选:3 步定下本地语音转文字方案

【免费下载链接】whisper.cppPort of OpenAI's Whisper model in C/C++项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp

whisper.cpp 做模型选型,顺序很重要:先写下设备能给的内存和延迟预算,再回头去 tiny / base / small / medium / large-v3-turbo 里挑对应的那一档。反过来先下最大的模型,大概率会在加载阶段就翻车。

一次翻车现场:medium 进了 4 GB 的盒子

最常见的坑不是模型不够准,而是内存没算清。官方 README.md 里有一张内存表:medium 的磁盘文件是 1.5 GiB,驻留内存约 2.1 GB;large 磁盘 2.9 GiB,内存约 3.9 GB。把 medium 塞进一台 4 GB 的嵌入式盒子,加载完就只剩几百 MB 余量,转录稍长的音频直接 OOM;换 tiny,内存占用降到 ~273 MB,同一台盒子跑起来毫无压力。

所以本地部署语音转文字之前,先问一句:这台机器能腾出多少连续内存?

手机、桌面、服务器:三档预算表

按设备分档后,每档能跑的模型和实测速度一目了然(CPU 4 线程,i7-12700K 基准;手机数据为骁龙 888 实测):

设备档位内存预算可选模型转录速度(实时倍数)
手机 / 嵌入式≤ 1 GBtiny.en、basetiny.en 12.8x;base 约 3.5x
桌面 / 笔记本2–4 GBbase、small.enbase 6.5x,small.en 2.3x
服务器 / GPU 主机≥ 8 GBmedium、large-v3-turbomedium 0.9x,large-v3-turbo 0.5x

速度大于 1x 意味着处理比音频播放还快,可以接实时交互;小于 1x 不代表不能用,只是要按离线批处理的心态安排队列。

准确率换速度,代价明码标价

同一套标准样本上,各档的 WER 与首次响应延迟如下:

  • tiny.en:75 MiB,WER 18.7%,首包 83 ms
  • base:142 MiB,WER 11.2%,首包 145 ms
  • small.en:466 MiB,WER 6.4%,首包 320 ms
  • medium:1.5 GiB,WER 3.8%,首包 890 ms
  • large-v3-turbo:1.5 GiB,WER 2.1%,首包 1560 ms

读法很简单:从 tiny.en 升到 small.en,WER 从 18.7% 降到 6.4%,代价是速度慢约 5 倍;从 small.en 再上 turbo,WER 压到 2.1%,速度比 small.en 再慢约 4.5 倍。业务对错字能容忍到哪个程度,就停在对应那一档。

一条命令下模型,量化再省一截

./models/download-ggml-model.sh base.en

脚本 models/download-ggml-model.sh 直接给的是 ggml 格式,不用自己转换;不带参数运行会列出全部版本,其中包括 large-v3-q5_0(1.1 GiB)这类量化模型。磁盘和内存都紧张时,还能用 examples/quantize/quantize.cpp 把本地模型压到 q5_0:large 体积约省 40%,精度损失小于 1%。

在你自己的机器上复核一遍

上面表格里的速度只是参考,examples/bench/bench.cpp 才是最终裁判——它用随机音频跑一遍 Encoder 并计时:

./build/bin/whisper-bench -m ./models/ggml-base.en.bin -t 4

总耗时除以音频时长,就是你这台机器上的真实实时倍数。同一个模型在 4 核开发板和 16 核工作站上可能差出一个量级,选型结论以 bench 为准。

对号入座:实时、离线、批量

实时交互(智能音箱、车载):用 examples/stream/stream.cpp 的流式模式,base.en 在桌面机上 6.5x 的速度留足余量。

./build/bin/stream -m ./models/ggml-base.en.bin -t 4 --step 500 --length 5000

离线批量(会议录音、字幕生产):用 server 示例起 HTTP 服务挂队列,medium 或 large-v3-turbo 慢慢跑,0.5x~0.9x 的速度在夜间批处理里不是问题。

最后留一句可以复述的口诀:英文用 .en,内存紧先量化;实时要 base,离线上 turbo。完整模型清单与下载脚本,仓库根目录的 README.md 里都能查到。

【免费下载链接】whisper.cppPort of OpenAI's Whisper model in C/C++项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 16:20:58

10T模型时代来临:MoE架构、训练挑战与开发者应对指南

最近 AI 圈讨论最热的话题之一,是字节跳动被曝正在构建一个 10T 规模的模型,目标直指 Anthropic。乍看这是一条商业新闻:两家公司要在 AGI 赛道上正面碰撞。但如果只按商业新闻去理解,会错过真正重要的技术信号。10T model 如果落…

作者头像 李华
网站建设 2026/9/5 19:07:21

whisper.cpp CUDA加速:把跑一整夜的转录压进10分钟的3步配置法

whisper.cpp CUDA加速:把跑一整夜的转录压进10分钟的3步配置法 【免费下载链接】whisper.cpp Port of OpenAIs Whisper model in C/C 项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp 两小时的会议录音,用CPU转录到天亮还没跑完—…

作者头像 李华
网站建设 2026/9/5 18:49:07

城市生命线安全工程平台是什么?5 大核心功能与应用价值详解

城市燃气、供水、排水、供热、桥梁、隧道等基础设施构成了现代城市运转的底层脉络。随着我国城镇化从快速增长期转向存量提质增效阶段,管网老化、第三方施工破坏与极端天气冲击相互叠加,任何一处细微隐患都可能沿着地下管网层层传导。中央和地方相继部署…

作者头像 李华
网站建设 2026/9/5 16:21:09

城市体检数据汇聚平台是什么?5 大核心功能与应用价值详解

城市体检是综合评价城市发展建设状况、针对性解决“城市病”问题的基础性工作,也是实施城市更新行动、推动城市人居环境高质量发展的重要抓手。随着住房城乡建设部明确2024年起在地级及以上城市全面开展城市体检,各省及城市级信息平台的建设需求集中释放…

作者头像 李华
网站建设 2026/9/5 13:17:29

Lattice FPGA MII接口CRS信号处理实战:从悬空隐患到完整方案

最近在项目里用 Lattice ECP5 做一块带以太网接口的板卡,MII 模式对接外部 PHY 芯片时,碰到一个说大不大、说小不小的坑:PHY 输出的 CRS 信号到底怎么处理。翻出 Lattice 的应用笔记 LAT1595 仔细看了一遍,又结合自己调试过程中的…

作者头像 李华