GPT-SoVITS Windows本地部署教程

依据GPT-SoVITS官方仓库整理Windows 10/11本地部署教程,介绍官方整合包与Conda安装、CUDA/CPU选择、模型目录、卸载、安全与常见报错。

本地语音 AI · 官方资料核验于 2026-07-13

GPT-SoVITS是一套少样本语音合成与声音转换WebUI。官方说明可使用约5秒参考音频进行零样本TTS,也可用约1分钟数据微调。真正麻烦的不是点启动按钮,而是显卡环境、模型目录和合法使用边界。

来源说明:本文不重新打包程序、模型或依赖。Windows用户应从GPT-SoVITS官方GitHub仓库进入官方列出的整合包或安装脚本。项目代码采用MIT许可证,但训练素材、参考音频和各模型权重可能有各自许可证。

安装前确认配置

系统
官方说明Windows 10及以上已测试。
Python
推荐使用Conda创建Python 3.10环境。
显卡
NVIDIA CUDA更适合训练与较快推理;官方脚本也提供CPU选项。
磁盘
程序、PyTorch、预训练模型和数据集会占用大量空间,建议至少预留20GB,训练数据另算。

方法一:使用官方列出的Windows整合包

  1. 进入GPT-SoVITS官方仓库
  2. 在README的Windows安装段落中打开官方列出的整合包地址。
  3. 下载完成后先核对文件来源与下载页面,不要从陌生群聊、网盘转存链接获取。
  4. 解压到纯英文、路径较短的目录,例如D:\AI\GPT-SoVITS
  5. 双击go-webui.bat启动完整WebUI;只进行推理时,可按官方README使用对应推理入口。

整合包适合新手,但体积较大。Windows报错中相当一部分来自中文路径、压缩包未完整解压、杀毒软件隔离文件或显卡驱动与PyTorch不匹配,人类把路径命名成一整句诗后又责怪程序,属于传统节目。

方法二:Conda与官方PowerShell脚本

希望环境更透明时,可按官方README创建独立环境。下面命令必须在项目根目录执行:

conda create -n GPTSoVits python=3.10
conda activate GPTSoVits
pwsh -F install.ps1 --Device CU126 --Source HF

--Device应根据环境改为官方支持的CUDA或CPU选项;不要凭显卡型号猜CUDA版本。先更新NVIDIA驱动,再确认安装脚本当前支持的设备参数。

第一次运行的正确顺序

  1. 先启动WebUI,确认页面能打开。
  2. 使用你有权处理的清晰人声素材,去除背景音乐和明显混响。
  3. 按“切分 → 可选降噪 → ASR → 校对文本 → 训练”的顺序处理数据。
  4. 首次测试优先使用短文本,确认语言、参考音频和模型版本一致。
  5. 训练成功后再做长文本和批量生成,避免在错误环境上浪费数小时。

常见报错排查

启动后窗口闪退

从命令行运行批处理文件以保留报错信息;确认目录没有中文、空格过多或权限限制,并检查文件是否被安全软件隔离。

提示找不到FFmpeg

官方手动安装说明要求安装FFmpeg。Conda用户可在环境中执行conda install ffmpeg;手动方式应按官方说明放置ffmpeg.exeffprobe.exe

CUDA不可用或显存不足

核对驱动、PyTorch与CUDA组合。显存不足时可减小批量、缩短音频、关闭不需要的工具,或使用CPU模式测试。不要从随机论坛下载所谓“CUDA修复器”。

生成声音重复、漏字或音色异常

先缩短文本并检查标点、语言选择、参考音频质量和模型版本。官方README说明不同版本的特性不同,升级前应备份训练结果。

卸载与回滚

整合包通常可在停止程序后删除整个目录;如使用Conda,可执行:

conda deactivate
conda env remove -n GPTSoVits

删除前备份训练权重、标注文件、原始音频和生成结果。若使用Docker,还应停止并删除相关容器、镜像和挂载目录。

声音权利安全:只使用本人声音、明确授权素材或许可证允许的语音。不得冒充他人、伪造客服或熟人语音、制作欺诈内容,也不要公开上传包含隐私的原始录音。

官方来源与许可证

核验日期:2026-07-13。本文未提供自制部署包,因此没有下载文件SHA-256;所有程序与模型下载均应从上游官方入口完成。

说明:本文用于介绍产品功能、订阅管理或操作流程,不代表相关品牌的官方承诺。产品名称、价格、功能和政策可能变化,请以对应官方页面的最新信息为准。