Voice model training — Train conversion models with minimal audio data (≥10 minutes recommended).
Real-time voice conversion — Process audio with 90-170ms latency depending on hardware and ASIO support.
Vocal-instrumental separation — Isolate vocals and accompaniment using UVR5 models.
Pitch extraction — Extract pitch using RMVPE algorithm for artifact-free conversion.
Model merging — Blend trained models to create custom voice characteristics.
Retrieval-based Voice Conversion eliminates voice leakage by replacing input features with training set features. It works on modest GPUs, accepts small datasets, and includes both web training interface and real-time conversion GUI. Multi-GPU support and device acceleration (RTX, AMD ROCM, Intel IPEX) make it accessible across hardware configurations.
Python 3.8+, PyTorch, FFmpeg, 10+ minutes of clean audio for training