安装前先确认系统与空间
上游明确支持 Windows 的 MSVC 与 MinGW 构建,但没有规定统一的最低内存。本文采用 64 位 Windows、CMake 与 Visual Studio Build Tools 的 C++ 编译环境。纯 CPU 可以运行;NVIDIA CUDA、Vulkan 等加速属于可选项。
| 项目 | 建议与官方事实 |
|---|---|
| 依赖 | Git、CMake、可用的 C/C++ 编译器;Visual Studio Build Tools 是 Windows 上常用选择 |
| 模型空间 | 官方模型表中 tiny 约 75 MiB、base 约 142 MiB、small 约 466 MiB;另需预留源码、构建文件、原音频与输出空间 |
| 中文模型 | 选择 base、small 等多语言模型;名称带 .en 的模型仅适合英语 |
| 许可证 | whisper.cpp 代码采用 MIT License;模型来源与使用条件应在下载页另行核对 |
第一步:从官方仓库编译 CPU 版本
在“x64 Native Tools Command Prompt for VS”或已配置好编译器的终端中执行:
git clone https://github.com/ggml-org/whisper.cpp.git
cd whisper.cpp
cmake -B build
cmake --build build --config Release官方快速入门使用 CMake 构建。若命令提示找不到编译器,先确认 Visual Studio Installer 中已安装“使用 C++ 的桌面开发”,再删除未完成的 build 目录后重新生成。
第二步:下载适合中文的 GGML 模型
Windows 仓库中提供官方批处理脚本。先从体积较小的多语言 base 开始:
models\download-ggml-model.cmd base成功后应出现 models\ggml-base.bin。不要把 base.en 用于中文录音。需要更大模型时,先根据官方模型表确认文件大小和机器可承受的推理速度;本文不代存模型文件,也不承诺不同硬件的处理耗时。
第三步:先用样例验证,再处理自己的音频
build\bin\Release\whisper-cli.exe -m models\ggml-base.bin -f samples\jfk.wav样例能输出文字,说明程序和模型都已加载。随后把 -f 后的路径替换为自己的音频。路径包含空格时要加双引号。官方基础示例以 WAV 为主;如果需要直接处理 Opus 等格式,可按上游说明启用 FFmpeg 集成后重新构建,不要默认所有压缩音频都能直接读取。
导出字幕与查看全部参数
不同版本的 CLI 参数可能调整,先运行 whisper-cli.exe --help 查看当前版本支持的输出格式、语言和线程选项。需要中文时可显式选择中文,或让模型自动识别;字幕时间轴的准确度仍受录音质量、背景噪声和说话重叠影响,输出应人工复核。
可选:启用 NVIDIA CUDA
官方给出的 CUDA 构建开关是:
cmake -B build-cuda -DGGML_CUDA=1
cmake --build build-cuda --config Release这要求本机 CUDA 工具链与显卡驱动正确匹配。若配置阶段找不到 CUDA,先继续使用 CPU 版本,不要从不明网盘下载所谓“缺失 DLL”。
常见问题排查
模型下载完成但提示文件不存在
确认命令所在目录是仓库根目录,并检查模型实际路径是否为 models\ggml-base.bin。不要把脚本输出的模型名与命令中的 -m 路径混用。
中文结果变成英文或乱码
优先确认没有下载带 .en 后缀的英语专用模型。乱码通常还与终端编码或输出文件打开方式有关,可先把结果保存为 UTF-8 后再查看。
录音打不开
先转换为常见 PCM WAV 做基础验证。若要让 whisper.cpp 直接读取更多格式,按官方 FFmpeg 构建说明启用支持;仅安装 FFmpeg 不一定等同于当前二进制已经启用该功能。
卸载、隐私与安全提示
停止正在运行的 CLI 后,删除 whisper.cpp 仓库目录、模型和输出文件即可移除本项目;Git、CMake、Visual Studio 等共享开发工具应单独决定是否卸载。本地 CLI 在程序与模型就绪后可在本机执行推理,但第三方图形界面、在线模型源或额外插件可能有不同的数据处理方式。
- 敏感录音不要上传到来路不明的网页或整合包。
- 只从上游仓库与其列出的模型地址下载,校验官方模型表中的哈希。
- 转写可能漏字或误判人名、数字和专业术语,不应未经复核直接用于医疗、法律或财务结论。
相关教程与官方来源
如果你还需要本地大模型推理,可继续阅读 llama.cpp Windows运行GGUF模型教程 与 Ollama Windows本地部署教程;语音生成方向可参考 GPT-SoVITS Windows安装指南。