VoiceStudio : une alternative open source et entièrement locale à ElevenLabs
VoiceStudio apporte le clonage vocal, le doublage, la dictée, la transcription et les livres audio sur votre matériel grâce à 16 moteurs TTS et 11 moteurs ASR.
VoiceStudio : une alternative open source et entièrement locale à ElevenLabs
Les plateformes vocales cloud sont pratiques, mais elles impliquent aussi des coûts récurrents, des limites d’utilisation, la création d’un compte et un parcours des données qui peut ne pas convenir aux enregistrements privés. VoiceStudio adopte l’approche inverse : il s’agit d’une application open source de bureau et de serveur local destinée au clonage vocal, à la création de voix, au doublage vidéo, à la dictée, à la transcription et à la production audio longue durée.
Le projet prend en charge 16 moteurs de synthèse vocale, 11 moteurs de reconnaissance vocale et un catalogue couvrant jusqu’à 646 langues TTS. Il fonctionne sur macOS, Windows, Linux et Docker, avec prise en charge de CUDA, d’Apple Silicon MPS/MLX, de Linux ROCm, de l’inférence CPU et de workers distants facultatifs.
Le résultat ressemble moins à un simple modèle de génération vocale qu’à une plateforme locale de production vocale. Vous pouvez sélectionner les moteurs pour chaque tâche, conserver les données des projets sur disque, exposer une API compatible avec OpenAI ou connecter des agents IA via MCP.
VoiceStudio est actuellement en bêta active. Utilisez la dernière version pour les travaux stables ; la branche
mainpeut changer entre les versions.
Pourquoi la génération vocale locale est importante
Un service vocal hébergé gère généralement les modèles, les GPU, la mise à l’échelle et les mises à jour à votre place. La configuration est ainsi simplifiée, mais cela signifie aussi que l’audio et le texte sont traités par un fournisseur et que vos coûts augmentent avec l’utilisation. VoiceStudio transfère ces compromis sur votre propre machine :
| Préoccupation | VoiceStudio | Service hébergé classique |
|---|---|---|
| Parcours des données | Local par défaut ; les fonctionnalités distantes sont facultatives | L’audio et le texte sont traités par le fournisseur |
| Coût | Logiciel gratuit ; vous fournissez le matériel | Abonnement, crédits ou utilisation d’une API facturée à la consommation |
| Utilisation hors ligne | Oui, une fois les modèles installés | Nécessite généralement une connexion Internet |
| Personnalisation | Open source, plusieurs moteurs, routage local | Limitée aux options du fournisseur |
| Performances | Dépendent de votre matériel et du moteur | Le fournisseur gère le calcul et la mise à l’échelle |
| Maintenance | Vous gérez les modèles, les mises à jour, le stockage et le calcul | Le fournisseur gère l’infrastructure |
Cela le rend particulièrement utile pour les enregistrements privés, les applications internes, la génération à grande échelle, les flux de travail hors ligne et les développeurs qui souhaitent contrôler le choix des modèles.
Ce que vous pouvez créer avec VoiceStudio
VoiceStudio regroupe ses fonctionnalités en plusieurs flux de production.
Clonage et création de voix
L’espace de travail Voice comprend trois modes principaux :
- À partir d’un fichier audio — cloner une voix à partir d’un court extrait de référence.
- Par conception — créer une voix à partir d’attributs tels que l’âge, l’accent, la hauteur, le style et le débit.
- Convertir — effectuer une conversion parole-à-parole.
Pour le clonage zero-shot, un extrait de trois secondes peut fonctionner, tandis que 5 à 15 secondes fournissent généralement un meilleur prompt. La référence doit contenir un seul locuteur et un minimum de bruit, de musique ou de réverbération. Un audio plus long n’est pas automatiquement meilleur, car l’extrait sert de prompt et non de données d’entraînement.
Une première génération typique se déroule comme suit :
- Lancez VoiceStudio et ouvrez Clonage vocal.
- Ajoutez un enregistrement de référence propre.
- Saisissez le texte à synthétiser.
- Sélectionnez la langue et le profil vocal.
- Choisissez Générer.
Le clonage vocal ne doit être effectué qu’avec l’autorisation explicite du locuteur.
Doublage vidéo
Le flux de doublage peut transcrire une vidéo, traduire ses dialogues, conserver l’attribution des locuteurs, synthétiser de nouvelles voix et exporter une vidéo terminée. Il prend en charge l’importation de fichiers et d’URL, les sous-titres, la connexion facultative à YouTube, la modification des transcriptions, les glossaires, la sélection des pistes et la vérification de la synchronisation.
L’éditeur combine une forme d’onde et une transcription synchronisée dans un même espace de travail. Cliquez sur la forme d’onde pour avancer ou reculer, ou faites glisser une forme d’onde zoomée pour la déplacer. La langue de traduction et les contrôles de code ISO restent synchronisés, tandis que les segments de transcription affichent le texte, le minutage, l’état et les contrôles vocaux.
Les doublages terminés peuvent signaler les problèmes de synchronisation pour vérification avant l’exportation. Les moteurs sans clonage sont refusés dans les flux qui doivent préserver un locuteur de référence, plutôt que de basculer silencieusement vers un autre moteur.
Livres audio et audio longue durée
L’éditeur de livres audio prend en charge les scripts à plusieurs voix, l’importation d’EPUB et de PDF, le rendu des chapitres et l’exportation en .m4b. L’éditeur de scripts occupe l’espace principal, tandis que les attributions vocales et les paramètres du livre restent dans des onglets distincts, ce qui facilite la gestion des projets longs sans mélanger les paramètres de production et la modification du texte.
Dictée et transcription
VoiceStudio comprend un widget de dictée à l’échelle du système avec raccourci global, transcription en direct et nettoyage facultatif par un LLM local. Pour la reconnaissance vocale, les utilisateurs peuvent choisir entre WhisperX, Faster-Whisper, MLX Whisper, Parakeet, Moonshine, FunASR, Sherpa-ONNX et des serveurs compatibles avec OpenAI configurés.
WhisperX est le choix par défaut pour le doublage, les sous-titres, le minutage au niveau des mots et la diarisation. Les utilisateurs d’Apple Silicon peuvent utiliser MLX Whisper ou Parakeet MLX, tandis que les systèmes uniquement CPU peuvent utiliser Moonshine ou Faster-Whisper en int8 pour réduire la consommation mémoire.
Outils multimédias supplémentaires
La plateforme comprend également :
- Isolation des voix avec Demucs
- Diarisation des locuteurs avec Pyannote et WhisperX
- Files d’attente par lots pour les tâches audio et vidéo
- Surveillance des dossiers pour les nouvelles vidéos ajoutées
- Intégration et détection de filigranes IA via AudioSeal
- Téléchargements distants de modèles pour les workers inscrits
- Catalogue de modèles pour installer, supprimer et router les moteurs
Options d’installation
Le projet fournit des versions packagées pour macOS, Windows et Linux, ainsi que des images Docker.
| Plateforme | Paquet ou prérequis |
|---|---|
| macOS | Apple Silicon, macOS 13.3+, DMG |
| Windows | Windows 10/11 x64, MSI ; l’installation pour l’utilisateur actuel est disponible |
| Linux | x86_64 avec glibc 2.39+, AppImage |
| Docker | Images Linux/AMD64 avec profils CUDA, ROCm, CPU et GPU uniquement pour workers |
Au premier lancement, VoiceStudio crée un environnement Python géré et télécharge le modèle par défaut. Les lancements suivants réutilisent cet environnement et le cache des modèles.
Pour Docker, les images publiées sont uniquement disponibles pour linux/amd64 :
docker run -d \\
-p 127.0.0.1:3900:3900 \\
-v omnivoice-data:/app/omnivoice_data \\
--name voicestudio \\
palashdeb/omnivoice-studio:stable
Les utilisateurs d’Apple Silicon devraient généralement utiliser l’application macOS native pour l’accélération GPU. Les hôtes ARM64 doivent vérifier les exigences d’architecture avant de télécharger une image conteneur.
Exécution depuis les sources
Le développement nécessite Node 20 ou une version ultérieure, Bun et Python 3.11 ou une version ultérieure :
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
Le lanceur de bureau configure automatiquement les dépendances Python via uv. Pour exécuter l’interface dans le navigateur :
bun run dev
Si le démarrage échoue, lancez les diagnostics intégrés depuis Paramètres → À propos → Exécuter l’auto-vérification, ou exécutez :
uv run python backend/main.py --diagnose --deep
Matériel et sélection des moteurs
VoiceStudio prend en charge l’utilisation du CPU, mais un GPU peut améliorer considérablement la vitesse de génération. Le projet indique les exigences de base suivantes pour son flux de travail local par défaut :
| Ressource | Minimum | Recommandé |
|---|---|---|
| RAM | 8 Go | 16 Go ou plus |
| Espace disque libre | 10 Go | 20 Go ou plus sur un SSD |
| VRAM | 4 Go pour l’utilisation du GPU | 8 Go ou plus |
| Python | 3.11+ | 3.11 ou 3.12 |
Les grands moteurs facultatifs peuvent nécessiter 12 à 16 Go de VRAM ou plus. ROCm est réservé à Linux et doit être activé explicitement ; les systèmes Windows AMD/Ryzen AI utilisent l’inférence CPU. Les systèmes disposant d’une VRAM limitée peuvent déporter certaines tâches vers le CPU.
Les combinaisons recommandées comprennent :
- Apple Silicon M1 à M4 : MLX-Audio ou OmniVoice avec MPS ; MLX Whisper ou Parakeet MLX pour l’ASR.
- GPU NVIDIA avec au moins 8 Go de VRAM : OmniVoice ou CosyVoice 3 ; WhisperX pour la transcription et la diarisation.
- VRAM limitée ou CPU uniquement : PocketTTS, Sherpa-ONNX ou KittenTTS ; Moonshine ou Faster-Whisper en int8 pour l’ASR.
Le catalogue de moteurs comprend OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, MOSS-TTS, KittenTTS, MLX-Audio, Sherpa-ONNX, IndexTTS, PocketTTS, Supertonic, dots.tts et Confucius4-TTS. Les fonctionnalités diffèrent considérablement : certains prennent en charge le clonage et la synthèse guidée par instructions, tandis que d’autres sont axés sur le CPU ou limités à certaines langues.
Vérifiez toujours la couverture linguistique d’un moteur, la prise en charge de votre plateforme, les besoins en mémoire, les capacités de clonage et la licence du modèle avant de l’utiliser en production.
API locale et compatibilité avec OpenAI
L’application de bureau communique avec un backend FastAPI lié à localhost:3900. Le backend expose une API REST, des Server-Sent Events, des WebSockets, une API audio compatible avec OpenAI et un serveur MCP.
Modifiez l’URL de base d’un client OpenAI pour utiliser le backend local :
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3900/v1",
api_key="local",
)
with client.audio.speech.with_streaming_response.create(
model="tts-1",
voice="<profile-id>",
input="Made on my own hardware.",
response_format="wav",
) as response:
response.stream_to_file("speech.wav")
Une requête cURL est tout aussi simple :
curl http://localhost:3900/v1/audio/speech \\
-H "Content-Type: application/json" \\
-d '{
"model": "tts-1",
"input": "Made on my own hardware.",
"voice": "default",
"response_format": "wav"
}' \\
--output speech.wav
Les points de terminaison importants comprennent :
POST /v1/audio/speech— générer des fichiers audio MP3, Opus, AAC, FLAC, WAV ou PCM.POST /v1/audio/transcriptions— renvoyer du JSON, du texte, du JSON détaillé, du SRT ou du VTT.WS /v1/audio/transcriptions/stream— diffuser les événements de transcription partiels et finaux.GET /v1/audio/voices— répertorier les profils vocaux et les moteurs locaux.GET /.well-known/voicestudio-speech— découvrir les transports vocaux disponibles.
Les appels loopback ne nécessitent pas de clé serveur. L’accès distant exige un code PIN de partage ou une clé API, et les déploiements sur réseau local, Tailscale ou via proxy doivent suivre les recommandations d’authentification du projet.
MCP et intégrations avec les agents
VoiceStudio inclut un serveur MCP à l’adresse http://localhost:3900/mcp, permettant à Claude Desktop, Cursor et à d’autres clients MCP d’appeler les outils de synthèse et de transcription.
{
"mcpServers": {
"voicestudio": {
"url": "http://localhost:3900/mcp"
}
}
}
Pour les clients qui nécessitent un transport stdio, le dépôt inclut un shim local :
{
"mcpServers": {
"voicestudio": {
"command": "python",
"args": ["-m", "backend.mcp_shim"],
"cwd": "/path/to/VoiceStudio"
}
}
}
Les outils MCP comprennent generate_speech, clone_voice et transcribe, avec prise en charge des modes de diffusion de fichiers et des liaisons clientes. Les compétences de projet pour Claude Code, Codex, Cursor et les agents compatibles peuvent être installées avec :
npx skills add debpalash/VoiceStudio
Confidentialité, sécurité et licence
Le flux de travail de bureau par défaut conserve les enregistrements, les transcriptions, les voix, les projets, les paramètres et les sorties sur la machine locale. Les workers distants et les points de terminaison ASR compatibles avec OpenAI sont activés explicitement par l’utilisateur. Les points de terminaison autres que loopback nécessitent HTTPS, et les redirections ne sont pas suivies.
Les analyses sont désactivées jusqu’à l’obtention du consentement. Si elles sont activées, elles envoient des métadonnées d’utilisation autorisées et dépourvues de contenu — pas de texte, d’audio, de noms de fichiers ou de données de projet.
VoiceStudio est distribué sous licence AGPL-3.0. Vous pouvez l’exécuter, le modifier et l’utiliser en interne. Si vous modifiez l’application et la fournissez en tant que service réseau, les obligations de l’AGPL vous imposent de proposer le code source correspondant sous la même licence. Une licence commerciale est disponible pour intégrer de manière propriétaire le code détenu par VoiceStudio, mais elle ne relicencie pas les modèles tiers.
Les conditions applicables aux modèles et aux tokeniseurs sont distinctes. Par exemple, la configuration OmniVoice par défaut inclut des poids préentraînés identifiés CC-BY-NC ainsi qu’un tokeniseur audio soumis à des conditions supplémentaires en amont. La licence de l’application n’accorde pas automatiquement de droits commerciaux sur chaque modèle téléchargé.
Le projet intègre également par défaut le filigranage AudioSeal afin d’aider à détecter et identifier les voix synthétiques sans modifier leur qualité audible.
À qui s’adresse-t-il ?
VoiceStudio convient particulièrement si vous avez besoin de :
- Génération vocale privée ou hors ligne
- Synthèse à grande échelle sans frais par requête
- Clonage vocal local et doublage multilingue
- Un flux de travail de bureau ainsi que des API programmables
- Plusieurs moteurs TTS et ASR dans une seule application
- Une intégration avec des agents de programmation via MCP
- Un contrôle du routage des modèles, du matériel et du stockage
Il est moins adapté si vous recherchez une mise à l’échelle cloud sans configuration, si vous ne disposez pas de suffisamment d’espace disque ou de puissance de calcul en local, ou si vous avez besoin d’un fournisseur unique proposant une licence commerciale unifiée pour chaque modèle.
Avec 26,9 k étoiles sur GitHub, 3,3 k forks, 38 versions et un développement actif, VoiceStudio est allé bien au-delà d’une simple démonstration de clonage vocal. La combinaison de ses outils de bureau, de ses API locales, du routage des modèles, de ses flux de doublage et de ses intégrations avec les agents en fait une base pratique pour les développeurs qui créent des applications vocales privées sur leur propre matériel.