
GPT-SoVITS完整指南用1分鐘語音克隆一個能用的聲音【免費下載鏈接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)項目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一個少樣本語音克隆 TTS 項目。它解決的問題很具體你手里只有幾分鐘甚至幾秒的某個人聲音素材但想把這個聲音變成一個可以輸入文本、輸出語音的模型。5 秒參考音頻就能零樣本合成1 分鐘音頻可以微調出專屬音色模型。 先說結論值不值得用值得。它覆蓋了從音頻切片、降噪、ASR 標注到模型訓練、推理的完整流程全在 WebUI 里點完。零樣本模式下 5 秒音頻即可出語音少樣本模式下 1 分鐘干凈音頻就能訓出相似度不錯的個人模型。適合播客作者、獨立開發者、內容創作者。上手成本是幾行 conda 命令加一個安裝腳本有 NVIDIA 顯卡的話從克隆倉庫到第一次合成成功大約 20 分鐘。 從零到出效果第一次合成走查第1步克隆倉庫并準備環境git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source ModelScope --download-uvr5install.sh 一條命令會裝好 ffmpeg、cmake、對應 CUDA 版本的 PyTorch 和全部 Python 依賴并自動下載預訓練模型到GPT_SoVITS/pretrained_models、G2PW 中文多音字模型到GPT_SoVITS/text。Windows 用戶把腳本換成install.ps1或者直接下載官方整合包雙擊go-webui.bat就行。第2步啟動 WebUIpython webui.py瀏覽器打開后界面分成數據準備1A、模型訓練1B、推理1C等 Tab推理 Tab 會再開一個獨立頁面默認端口 9872。第3步零樣本合成第一條語音打開1-GPT-SoVITS-TTS/1C-推理頁面SoVITS 和 GPT 下拉框里直接選預訓練底模無需訓練。上傳一段 5 秒左右的參考音頻填寫這段音頻對應的參考文本再輸入你要合成的目標文本并選擇文本語言點合成。幾秒鐘后就能得到用參考音色讀出的語音。第4步第一次微調把訓練音頻放進一個目錄在數據準備 Tab 按順序執行填音頻路徑 → 切割音頻按音量把長音頻切成小段→ 降噪可選→ ASR 自動轉寫 → 校對標注。標注完成后進入訓練 Tab依次跑 1a 文本分詞與特征提取、1b 語音自監督特征提取、1c 語義 Token 提取然后點 GPT 訓練、SoVITS 訓練。訓練完的權重會出現在下拉框里切到推理頁面選上它輸入同樣的文本即可對比微調前后的效果。? 能力拆解三個核心功能零樣本合成5秒音頻即可出語音原理是把參考音頻和參考文本作為提示配合預訓練底模直接生成。文本側有完整的前端做規范化和音素轉換中文多音字由 G2PW 模型處理。效果邊界在參考音頻5 秒音頻能定下音色基調但語速和情緒會跟著參考音頻走參考音頻里如果混著 BGM 或回聲合成質量會明顯下降先過一遍 UVR5 人聲分離和降噪再拿去當參考會穩很多。它支持跨語言參考音頻用中文目標文本可以寫英文、日文、韓文、粵語。少樣本微調1分鐘數據訓個人模型訓練分兩段GPTs1負責把文本映射成語義 token 序列SoVITSs2負責把 token 變成波形后者用的是 BigVGAN 聲碼器。相當于 GPT 先學說什么SoVITS 再學怎么聽起來像這個人。效果邊界有兩點一是訓練集質量決定上限官方說明里明確 v1/v2/v2Pro 系列對平均音質較低的訓練集更寬容v3/v4 則要求更干凈的數據二是 v4 原生輸出 48kHz 音頻v3 只有 24kHz聽感上 v3 會更悶。推理速度官方給出的參考數據README 里給了 v2 ProPlus 版本的 RTFRTX 4060Ti 上 0.0284090 上 0.0141400 詞約 4 分鐘語音實際推理耗時 3.36 秒M4 CPU 上 0.526。換算下來8GB 級別的消費級顯卡就能做到邊合成邊聽的體驗CPU 能跑但明顯慢。 真實用法一個做技術播客的作者每期節目開頭都是他自己的口播。他用 WebUI 的人聲分離把一期節目里的 BGM 去掉再把 5 分鐘音頻切片、降噪、ASR 自動轉寫校對掉幾個識別錯的多音字湊出約 1 分鐘的訓練集訓了一個自己的 GPT-SoVITS 模型。之后每期節目的口播、片尾和社群通知都是模型用他自己的聲音念出來的語速和情緒通過換參考音頻來微調。一個獨立游戲開發者要給 20 個 NPC 寫語音預算里沒有配音費。他先用零樣本模式拿演員朋友手機錄的 10 秒干聲當參考把全部臺詞過了一遍篩選掉讀錯的段落對主角這一個角色他讓對方在安靜房間補錄了 1 分鐘素材做了微調主角音色明顯比零樣本更穩NPC 們則繼續用零樣本加不同參考音頻區分開來。一個做內部工具的后端開發者想讓團隊的客服工單系統支持語音播報。他沒有重新造輪子而是直接調用倉庫里的 api.py 起一個本地推理服務工單狀態變化時把文本 POST 過去返回的合成音頻直接推給前端播放參考音頻固定用團隊選定的一個聲音整個服務跑在一臺 12GB 顯存的服務器上。?? 踩坑實錄Q1訓練時顯存不夠報 OOM 怎么辦先把 batch_size 減半。WebUI 的默認 batch size 是按顯存大小推算的v3/v4 默認按 顯存GB/8 給顯存緊張時手動調小是最直接的。同時確認走的是半精度訓練v3/v4 的 SoVITS 訓練 epoch 默認只有 2最多 16別為了多訓一點把參數往上堆。Q2中文合成時個別字讀音奇怪像日語發音十有八九是 G2PW 模型沒放對位置。把它解壓后重命名為G2PWModel放到GPT_SoVITS/text目錄下重啟 WebUI。install.sh 成功跑完的話這一步已經幫你做好了手動裝環境的人最容易漏。Q3合成出來的聲音發悶或者有金屬音這是版本混用的典型癥狀。v3 原生輸出 24kHz 音頻v4 為了修掉 v3 非整數倍上采樣導致的金屬音、改成原生 48kHz官方定位 v4 直接替代 v3。推理時不要混用不同版本的底模和微調權重LoRA 權重加載時如果對應底模缺失界面會直接報底模缺失無法加載相應 LoRA 權重看到這條提示就去GPT_SoVITS/pretrained_models補下載對應版本的底模。Q4服務器斷網ASR 用不了FunASR 系列模型默認在首次使用時自動下載。離線機器上把 ASR 模型、VAD 模型、標點模型預先下到tools/asr/models目錄模型來源見 README 的預訓練模型一節需要英語或日語轉寫的話把 faster-whisper-large-v3 放到同一目錄。UVR5 人聲分離的權重放tools/uvr5/uvr5_weights。Q5CPU 上能湊合用嗎能跑但要有預期。官方數據 M4 CPU 的 RTF 是 0.526合成 4 分鐘語音大約要花 2 分鐘批量干活不現實。想快就用 GPU或者在 WebUI 里開啟 batched 推理它會自動切換到 inference_webui_fast.py長文本合成速度會好一截。結尾現在就可以克隆倉庫、跑一遍 install.sh先拿 5 秒音頻體驗零樣本再錄 1 分鐘素材訓一個自己的模型。克隆地址https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS【免費下載鏈接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)項目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考