GPT-SoVITS
GPT-SoVITS is an open-source WebUI for few-shot voice cloning, voice conversion, and multilingual text-to-speech using short reference recordings.
Total stars
Last 7 days
60,905
HostingSelf-hostable
LicenseMIT
LanguagePython
Last commitJul 22, 2026
Latest releaseJun 6, 2025
Release frequency1.5 per year
Contributors100
Stars60,905
Forks6,613
Issues888
What it does
GPT-SoVITS is an open-source voice synthesis application with a WebUI for zero-shot and few-shot text-to-speech, voice conversion, and voice cloning. It can use a five-second vocal sample for instant synthesis or about one minute of training data for fine-tuning, with support for Chinese, English, Japanese, Korean, Cantonese, and related workflows.
The project includes tools for audio separation, dataset segmentation, multilingual ASR, transcription proofreading, model fine-tuning, inference, and speech-speed control. It can be installed on Windows, Linux, and macOS, run through Python and Conda, or deployed with Docker Compose; pretrained models and optional ASR and UVR5 models are downloaded separately.
Capabilities
#Text-to-speech voiceover production
#Voice cloning and design
#Speech transcription
Built with
Tools similar to GPT-SoVITS
ChatTTS
Audio Editing
Ebook2audiobook
Audio Editing
Voice-pro
Audio Editing
VoiceStudio
Audio Editing
EmotiVoice
Audio Editing
Abogen
Audio Editing