首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
GPT-SoVITS v4 一次跑通:1 分钟语音训练,直出 48k 克隆音色
📅 2026/9/7 4:44:15
✍️ 爱科研究院
👁 阅读 3,247
GPT-SoVITS v4 一次跑通1 分钟语音训练直出 48k 克隆音色【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个少样本 TTS文本转语音项目5 秒参考音频即可零样本克隆音色1 分钟训练数据能微调出高相似度专属音色。v4 原生输出 48kHz 音频1400 词约 4 分钟实测 3.36 秒合成完。能力清单五个硬指标一览这节说明 GPT-SoVITS 能做到什么程度。克隆音色只给 5 秒参考音频零样本 TTS 直接开口说话微调音色1 分钟音频训练得到高相似度专属音色直出 48kHz 成品v4 取代 v3 的 24k 输出不用额外升采样提速合成1400 词 3.36 秒RTX 4090 实测 RTF 0.014省训练集功夫WebUI 内置人声分离、自动切分、多语言 ASR 标注还支持中、英、日、韩、粤五种语言 最小环境配置与模型下载环境门槛一句话conda Python 3.10显卡支持 CUDA 12.6/12.8也兼容 ROCm、Apple MPS 和纯 CPU。git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source ModelScope--device按硬件选CU126 / CU128 / ROCM / MPS / CPU--source选模型下载源HF / HF-Mirror / ModelScope国内网络建议 ModelScope--download-uvr5顺带下载人声分离模型v4 需要GPT_SoVITS/pretrained_models/gsv-v4-pretrained/下有 s2Gv4.pth 和 vocoder.pth装完确认一下第一次 48k 合成走查第一次跑通只需两步启动 WebUI然后在页面里操作。python webui.py浏览器打开 9874 端口http://localhost:9874进入1-GPT-SoVITS-TTS→1C-推理标签页上传参考音频5 秒左右输入这段音频对应的参考文本输入想说的话选择文本语言点击合成生成后试听得到的就是 48kHz 音频️ 质量与速度的三个参数这节只列直接影响音质和速度的 3 个参数。机制一句话v4 声码器上采样链全是整数倍GPT_SoVITS/configs/s2v2ProPlus.json 里upsample_rates为 10×8×2×2×2从根上直接产出 48k没有 v3 的金属音。is_halfFP16 半精度开关开更快、省显存默认保持开启显存不足时关掉用 FP32 跑模型版本下拉框选择v4 音色保真、高频干净v2Pro 系列更快、硬件占用更小训练集音质一般时改选 v2ProCPU 导出GPT_SoVITS/export_torch_script.py导出优化后的模型CPU 推理提速无 GPU 场景使用长文本分段合成三类典型用法三个场景对应三种不同的起点素材。短视频/播客口播你手里有 1 分钟干净人声录音 → 你得到专属口播模型48k 成品直接交付跨语言配音你手里有中文训练素材 → 你得到日语、韩语、英语的同音色语音旧音频翻新你手里有带噪混响的旧录音 → 你得到干净的替代配音先人声分离、再降噪tools/cmd-denoise.py最后合成⚠️ 常见翻车与解法下面 5 条是命中率最高的问题按现象、原因、处理拆开写。现象音色下拉框为空原因预训练模型没放对位置处理检查GPT_SoVITS/pretrained_models/下有无对应版本的 .pth / .ckpt 文件现象合成出现金属音原因还在用 v3 权重处理换 v4 并重新下载 vocoder.pth现象提示未找到显卡自动退回 CPU原因驱动或 CUDA 没装处理装好驱动或显式指定--device CPU现象v3/v4 训练效果不如 v2原因对训练数据质量挑剔处理先做分离降噪或改用 v2Pro 系列现象Mac 上训出的模型质量偏低原因已知现象处理Mac 用户用 CPU 模式训练先用 5 秒参考音频跑一次零样本合成确认整条链路通了再准备 1 分钟干净人声做微调对比相似度差异。升级版本前先看 docs/cn/README.md 和 docs/cn/Changelog_CN.md。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/7 4:44:15
PostHog 的 GitHub Actions 实战:Depot 托管 Runner 的选型、缓存与调试全指南
2026/9/7 4:44:15
JSON for Modern C++ 中 nlohmann::basic_json::empty() 的深度解析:返回值语义、源码实现与测试验证
2026/9/7 4:39:15
WeGame AI落地首选金铲铲之战:自走棋场景的智能游戏伙伴技术拆解
2026/9/7 5:54:19
户外电容触摸显示器选型指南:高亮、全贴合与宽温防水全解析
2026/9/7 5:54:19
Deno 源码快速重建实战:用 cargo-plonk 符号热替换缩短开发编译周期
2026/9/7 5:54:19
芯片熔丝位烧写工具设计:eFuse/OTP配置与产线实践
2026/9/7 5:54:19
L1与L2正则化:从原理到实战,彻底解决过拟合
2026/9/7 5:54:19
STM32与DHT11温湿度传感器实战:从硬件原理到HAL库驱动与排错
2026/9/7 5:49:19
LLM提供商性能评估指南:延迟、吞吐量与可用性测试实践
2026/9/7 0:03:59
基于YOLOv8和PyQt5的麦穗稻穗检测识别系统设计与实现
2026/9/7 0:03:59
UL 1642锂电池安全标准全解析:测试项目、认证流程与避坑指南
2026/9/7 0:03:59
BS EN 13814-1-2019游乐设施安全标准:设计与制造核心要点解析
2026/9/7 0:22:31
超人会飞不算本事:系统稳定依赖清晰规则与边界设计
2026/9/7 0:44:48
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论
2026/9/7 1:55:33
基于CNN的调制信号识别:MATLAB实现时频图分类实战