GPT-SoVITS:5 秒音频零样本推理,1 分钟数据微调克隆专属音色

发布时间:2026/8/30 14:22:26
GPT-SoVITS:5 秒音频零样本推理,1 分钟数据微调克隆专属音色 GPT-SoVITS5 秒音频零样本推理1 分钟数据微调克隆专属音色【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的少样本语音克隆项目用 5 秒音频即可做零样本推理用 1 分钟训练数据可微调出高相似度音色支持中、英、日、韩、粤 5 种语言并内置从数据切割、自动标注到推理的完整 WebUI 流程。一眼看懂GPT-SoVITS 是什么GPT-SoVITS 把文本转语音拆成两段先用 GPT 结构的自回归模型把文本转成语音离散特征可以理解为先写出发音草稿再由 SoVITS 声学模型把这些特征还原成波形。它的特点是把语音克隆的门槛压得很低——不训练也能用训练一分钟就能显著拉近音色。关键指标一览数据均取自仓库文档项目说明最少样本量零样本推理只需 5 秒参考音频最少微调数据1 分钟训练音频支持语言中文、英语、日语、韩语、粤语共 5 种推理速度v2ProPlus 实测 RTF 0.0284060 Ti、0.0144090、0.526M4 纯 CPU运行环境Python 3.10/3.11PyTorch 2.5.1/2.7.0CUDA 12.4 或 12.8也支持 Apple 芯片与纯 CPUWebUI 端口主界面 9874推理界面 9872见 config.py 跑通第一次安装并启动 WebUI安装脚本会自动拉取依赖和预训练模型成功执行后无需再手动放置模型文件。以 Linux 为例git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HFWindows 用户可以直接下载文档中给出的整合包解压后双击 go-webui.bat 启动免去环境搭建国内网络建议把--source换成HF-Mirror或ModelScope。CUDA 版本对不上时把--device改为CU126或CPU即可。激活环境后执行下面这条命令浏览器访问 9874 端口打开的就是主 WebUIpython webui.py首次加载模型会慢一些加载完成后即可在1-GPT-SoVITS-TTS页签进入推理界面不训练直接选底模、上传参考音频就能出第一段合成音频。硬件方面不用太高规格config.py 会自动检测显卡显存低于 4GB 或不支持的架构会自动回退到 CPU 与单精度只是速度变慢不会报错。实操从录音到第一次完整合成数据准备要点训练集清单用.list文件描述每行格式为音频路径|说话人名|语言|文本语言代码取zh、en、ja、ko、yue之一。背景有伴奏或噪音的录音先用内置 UVR5 工具做人声分离模型放在 tools/uvr5/uvr5_weights。长音频先切割成短句片段WebUI 内置切割页也可用 tools/slicer2.py 命令行完成。文本标注交给 ASR 自动转写Fun-ASR-Nano / SenseVoice首次使用自动下载人工校对后再训练标注准确率直接影响合成质量。操作步骤全部在主 WebUI 内完成在0-前置数据集处理工具页填入训练音频目录路径。点击切割把长音频切成小片段。按需执行降噪可选。运行 ASR生成转写文本。在标注校对页逐条检查并修正文本。切到训练页先训练 GPTs1再训练 SoVITSs2产出权重存到logs目录。打开推理界面选择刚训练出的 GPT 与 SoVITS 权重上传参考音频约 5–10 秒、干净无噪粘贴目标文本点击合成。独立运行推理界面的方式是执行python GPT_SoVITS/inference_webui.py默认端口 9872适合训练和推理解耦使用。进阶与调参版本怎么选项目在 config.py 中维护了 v1 到 v4、v2Pro/v2ProPlus 共六个系列的预训练权重训练和推理时按版本选择即可版本一句话说明与适用场景v2底模扩充至 5k 小时数据新增韩语、粤语支持对低音质参考音频合成效果更稳适合入门v3音色相似度更高、重复漏字更少情感更丰富但原生输出 24kHz 音频v4修复 v3 的金属音问题并原生输出 48kHz文档定位是 v3 的直接替代适合追求高解析度v2Pro / v2ProPlus音质超过 v4显存占用比 v2 稍高保留 v2 的速度适合训练集音质一般的场景文档同时提示v3/v4 的合成音色更贴近参考音频本身而 v1/v2/v2Pro 更贴近整个训练集的风格选版本前先想清楚你要哪种效果。常见坑高频问题排查Mac 上为什么建议用 CPU 训练文档明确说明在 Mac 上用 GPU 训练出的模型质量显著低于其他设备因此暂时统一使用 CPU 训练。Docker 在 Windows 上运行异常Docker Desktop 默认共享内存偏小按 docker-compose.yaml 的说明把shm_size调大例如16g即可。合成音频里混进了参考音频的尾部这是早期已知问题更新日志显示已大幅削弱遇到时先确认代码与模型都更新到了最新版再复测。合成出来的声音发闷v3 原生输出 24kHz文档给出两条路换 v4 原生 48kHz或用 tools/AP_BWE_main 里的音频超分工具做 24k 到 48k 的补带宽。依赖安装失败或 CUDA 不匹配按文档重建环境删除 conda 环境后用 Python 3.10 重建再执行install.sh并指定正确的--deviceCU126/CU128/CPUFFmpeg 缺失时单独安装conda 用户conda install ffmpeg。延伸与资源文档和核心代码完整中文文档见 docs/cn/README.md更新记录见 docs/cn/Changelog_CN.md。GPT 自回归模型在 GPT_SoVITS/AR/models/SoVITS 声学模型在 GPT_SoVITS/module/models.py。多语言文本前端拼音、假名、声调处理集中在 GPT_SoVITS/text/中文拼音转换依赖 G2PW 模型。推理入口是 GPT_SoVITS/inference_webui.py服务化部署可看 api.py 与 api_v2.py。遇到问题优先查项目仓库的 Issues 区同类问题大多已有现成结论。先用 v2 底模跑通零样本推理确认参考音频质量达标后再录 1–3 分钟干净音频走一遍微调流程这是成本最低的上手路径如果合成音色偏差较大优先回到录音质量而不是训练参数。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考