GPT-SoVITS是一套少样本语音合成与声音转换WebUI。官方说明可使用约5秒参考音频进行零样本TTS,也可用约1分钟数据微调。真正麻烦的不是点启动按钮,而是显卡环境、模型目录和合法使用边界。
安装前确认配置
官方说明Windows 10及以上已测试。
推荐使用Conda创建Python 3.10环境。
NVIDIA CUDA更适合训练与较快推理;官方脚本也提供CPU选项。
程序、PyTorch、预训练模型和数据集会占用大量空间,建议至少预留20GB,训练数据另算。
方法一:使用官方列出的Windows整合包
- 进入GPT-SoVITS官方仓库。
- 在README的Windows安装段落中打开官方列出的整合包地址。
- 下载完成后先核对文件来源与下载页面,不要从陌生群聊、网盘转存链接获取。
- 解压到纯英文、路径较短的目录,例如
D:\AI\GPT-SoVITS。 - 双击
go-webui.bat启动完整WebUI;只进行推理时,可按官方README使用对应推理入口。
整合包适合新手,但体积较大。Windows报错中相当一部分来自中文路径、压缩包未完整解压、杀毒软件隔离文件或显卡驱动与PyTorch不匹配,人类把路径命名成一整句诗后又责怪程序,属于传统节目。
方法二:Conda与官方PowerShell脚本
希望环境更透明时,可按官方README创建独立环境。下面命令必须在项目根目录执行:
conda create -n GPTSoVits python=3.10 conda activate GPTSoVits pwsh -F install.ps1 --Device CU126 --Source HF
--Device应根据环境改为官方支持的CUDA或CPU选项;不要凭显卡型号猜CUDA版本。先更新NVIDIA驱动,再确认安装脚本当前支持的设备参数。
第一次运行的正确顺序
- 先启动WebUI,确认页面能打开。
- 使用你有权处理的清晰人声素材,去除背景音乐和明显混响。
- 按“切分 → 可选降噪 → ASR → 校对文本 → 训练”的顺序处理数据。
- 首次测试优先使用短文本,确认语言、参考音频和模型版本一致。
- 训练成功后再做长文本和批量生成,避免在错误环境上浪费数小时。
常见报错排查
启动后窗口闪退
从命令行运行批处理文件以保留报错信息;确认目录没有中文、空格过多或权限限制,并检查文件是否被安全软件隔离。
提示找不到FFmpeg
官方手动安装说明要求安装FFmpeg。Conda用户可在环境中执行conda install ffmpeg;手动方式应按官方说明放置ffmpeg.exe与ffprobe.exe。
CUDA不可用或显存不足
核对驱动、PyTorch与CUDA组合。显存不足时可减小批量、缩短音频、关闭不需要的工具,或使用CPU模式测试。不要从随机论坛下载所谓“CUDA修复器”。
生成声音重复、漏字或音色异常
先缩短文本并检查标点、语言选择、参考音频质量和模型版本。官方README说明不同版本的特性不同,升级前应备份训练结果。
卸载与回滚
整合包通常可在停止程序后删除整个目录;如使用Conda,可执行:
conda deactivate conda env remove -n GPTSoVits
删除前备份训练权重、标注文件、原始音频和生成结果。若使用Docker,还应停止并删除相关容器、镜像和挂载目录。
官方来源与许可证
核验日期:2026-07-13。本文未提供自制部署包,因此没有下载文件SHA-256;所有程序与模型下载均应从上游官方入口完成。