whisper.cpp Windows本地语音转文字教程

从官方源码编译开始,完成多语言模型下载、中文音频转写、字幕导出与可选的 CUDA 加速。本文不提供第三方整合包,所有程序与模型均指向上游官方来源。

适用对象:希望在 Windows 电脑本地把会议录音、访谈或视频音轨转换成文本与字幕,并愿意使用命令行的用户。whisper.cpp 是推理工具,不负责训练模型。

安装前先确认系统与空间

上游明确支持 Windows 的 MSVC 与 MinGW 构建,但没有规定统一的最低内存。本文采用 64 位 Windows、CMake 与 Visual Studio Build Tools 的 C++ 编译环境。纯 CPU 可以运行;NVIDIA CUDA、Vulkan 等加速属于可选项。

项目建议与官方事实
依赖Git、CMake、可用的 C/C++ 编译器;Visual Studio Build Tools 是 Windows 上常用选择
模型空间官方模型表中 tiny 约 75 MiB、base 约 142 MiB、small 约 466 MiB;另需预留源码、构建文件、原音频与输出空间
中文模型选择 base、small 等多语言模型;名称带 .en 的模型仅适合英语
许可证whisper.cpp 代码采用 MIT License;模型来源与使用条件应在下载页另行核对

第一步:从官方仓库编译 CPU 版本

在“x64 Native Tools Command Prompt for VS”或已配置好编译器的终端中执行:

git clone https://github.com/ggml-org/whisper.cpp.git
cd whisper.cpp
cmake -B build
cmake --build build --config Release

官方快速入门使用 CMake 构建。若命令提示找不到编译器,先确认 Visual Studio Installer 中已安装“使用 C++ 的桌面开发”,再删除未完成的 build 目录后重新生成。

第二步:下载适合中文的 GGML 模型

Windows 仓库中提供官方批处理脚本。先从体积较小的多语言 base 开始:

models\download-ggml-model.cmd base

成功后应出现 models\ggml-base.bin。不要把 base.en 用于中文录音。需要更大模型时,先根据官方模型表确认文件大小和机器可承受的推理速度;本文不代存模型文件,也不承诺不同硬件的处理耗时。

第三步:先用样例验证,再处理自己的音频

build\bin\Release\whisper-cli.exe -m models\ggml-base.bin -f samples\jfk.wav

样例能输出文字,说明程序和模型都已加载。随后把 -f 后的路径替换为自己的音频。路径包含空格时要加双引号。官方基础示例以 WAV 为主;如果需要直接处理 Opus 等格式,可按上游说明启用 FFmpeg 集成后重新构建,不要默认所有压缩音频都能直接读取。

导出字幕与查看全部参数

不同版本的 CLI 参数可能调整,先运行 whisper-cli.exe --help 查看当前版本支持的输出格式、语言和线程选项。需要中文时可显式选择中文,或让模型自动识别;字幕时间轴的准确度仍受录音质量、背景噪声和说话重叠影响,输出应人工复核。

可选:启用 NVIDIA CUDA

官方给出的 CUDA 构建开关是:

cmake -B build-cuda -DGGML_CUDA=1
cmake --build build-cuda --config Release

这要求本机 CUDA 工具链与显卡驱动正确匹配。若配置阶段找不到 CUDA,先继续使用 CPU 版本,不要从不明网盘下载所谓“缺失 DLL”。

常见问题排查

模型下载完成但提示文件不存在

确认命令所在目录是仓库根目录,并检查模型实际路径是否为 models\ggml-base.bin。不要把脚本输出的模型名与命令中的 -m 路径混用。

中文结果变成英文或乱码

优先确认没有下载带 .en 后缀的英语专用模型。乱码通常还与终端编码或输出文件打开方式有关,可先把结果保存为 UTF-8 后再查看。

录音打不开

先转换为常见 PCM WAV 做基础验证。若要让 whisper.cpp 直接读取更多格式,按官方 FFmpeg 构建说明启用支持;仅安装 FFmpeg 不一定等同于当前二进制已经启用该功能。

卸载、隐私与安全提示

停止正在运行的 CLI 后,删除 whisper.cpp 仓库目录、模型和输出文件即可移除本项目;Git、CMake、Visual Studio 等共享开发工具应单独决定是否卸载。本地 CLI 在程序与模型就绪后可在本机执行推理,但第三方图形界面、在线模型源或额外插件可能有不同的数据处理方式。

  • 敏感录音不要上传到来路不明的网页或整合包。
  • 只从上游仓库与其列出的模型地址下载,校验官方模型表中的哈希。
  • 转写可能漏字或误判人名、数字和专业术语,不应未经复核直接用于医疗、法律或财务结论。

相关教程与官方来源

如果你还需要本地大模型推理,可继续阅读 llama.cpp Windows运行GGUF模型教程Ollama Windows本地部署教程;语音生成方向可参考 GPT-SoVITS Windows安装指南

核验日期:2026-07-17。上游版本、构建参数和模型清单可能变化,请以官方仓库当前说明为准。