VoiceStudio: una alternativa a ElevenLabs totalmente local y de código abierto
VoiceStudio incorpora clonación de voz, doblaje, dictado, transcripción y audiolibros a tu propio hardware con 16 motores de TTS y 11 de ASR.
VoiceStudio: una alternativa a ElevenLabs totalmente local y de código abierto
Las plataformas de voz en la nube son prácticas, pero también introducen costes recurrentes, límites de uso, requisitos de cuenta y un flujo de datos que puede no ser adecuado para grabaciones privadas. VoiceStudio adopta el enfoque contrario: es una aplicación de escritorio y servidor local de código abierto para clonación de voz, diseño de voces, doblaje de vídeo, dictado, transcripción y producción de audio de larga duración.
El proyecto admite 16 motores de texto a voz, 11 motores de reconocimiento de voz y un catálogo que cubre hasta 646 idiomas TTS. Funciona en macOS, Windows, Linux y Docker, con compatibilidad con CUDA, Apple Silicon MPS/MLX, Linux ROCm, inferencia en CPU y workers remotos opcionales.
El resultado se parece menos a un único modelo de generación de voz y más a una plataforma local de producción de voz. Puedes seleccionar motores para cada tarea, mantener los datos de los proyectos en el disco, exponer una API compatible con OpenAI o conectar agentes de IA mediante MCP.
VoiceStudio está en beta activa. Usa la versión más reciente para trabajos estables; la rama
mainpuede cambiar entre versiones.
Por qué importa la generación de voz local
Un servicio de voz alojado normalmente gestiona los modelos, las GPU, el escalado y las actualizaciones. Esto facilita la configuración, pero también significa que el audio y el texto son procesados por un proveedor y que los costes aumentan con el uso. VoiceStudio traslada esas decisiones a tu propio equipo:
| Aspecto | VoiceStudio | Servicio alojado típico |
|---|---|---|
| Flujo de datos | Local de forma predeterminada; las funciones remotas son opcionales | El proveedor procesa el audio y el texto |
| Coste | Software gratuito; tú proporcionas el hardware | Suscripción, créditos o uso de API medido |
| Uso sin conexión | Sí, después de instalar los modelos | Normalmente requiere conexión a Internet |
| Personalización | Código abierto, múltiples motores y enrutamiento local | Limitada a las opciones del proveedor |
| Rendimiento | Depende de tu hardware y del motor | El proveedor gestiona la computación y el escalado |
| Mantenimiento | Gestionas modelos, actualizaciones, almacenamiento y computación | El proveedor gestiona la infraestructura |
Esto resulta especialmente útil para grabaciones privadas, aplicaciones internas, generación de gran volumen, flujos de trabajo sin conexión y desarrolladores que necesitan controlar la selección de modelos.
Qué puedes crear con VoiceStudio
VoiceStudio agrupa sus funciones en varios flujos de producción.
Clonación y diseño de voces
El espacio de trabajo de voz incluye tres modos principales:
- Desde audio — clona una voz a partir de un breve clip de referencia.
- Por diseño — crea una voz a partir de atributos como edad, acento, tono, estilo y forma de hablar.
- Convertir — realiza conversión de voz a voz.
Para la clonación zero-shot, un clip de tres segundos puede funcionar, aunque 5–15 segundos suelen proporcionar un mejor prompt. La referencia debe contener una sola persona y el mínimo ruido, música o reverberación posible. Un audio más largo no es automáticamente mejor, porque el clip actúa como prompt y no como datos de entrenamiento.
Una primera generación típica sería la siguiente:
- Inicia VoiceStudio y abre Clonación de voz.
- Añade una grabación de referencia limpia.
- Introduce el texto que quieres sintetizar.
- Selecciona el idioma y el perfil de voz.
- Elige Generar.
La clonación de voz solo debe realizarse con el permiso explícito de la persona hablante.
Doblaje de vídeo
El flujo de doblaje puede transcribir un vídeo, traducir sus diálogos, conservar las asignaciones de hablantes, sintetizar nuevas voces y exportar un vídeo terminado. Admite la carga de archivos y la importación desde URL, subtítulos, inicio de sesión opcional en YouTube, edición de transcripciones, glosarios, selección de pistas y revisión de tiempos.
El editor combina una forma de onda y una transcripción sincronizada en un mismo espacio de trabajo. Haz clic en la forma de onda para desplazarte, o arrastra una forma de onda ampliada para recorrerla. Los controles de idioma de traducción y código ISO permanecen sincronizados, mientras que los segmentos de la transcripción muestran texto, tiempos, estado y controles de voz.
Los doblajes terminados pueden señalar problemas de sincronización para revisarlos antes de exportar. Los motores que no admiten clonación se rechazan en los flujos de trabajo que requieren conservar la voz de referencia, en lugar de cambiar silenciosamente a otro motor.
Audiolibros y audio de larga duración
El editor de audiolibros admite guiones con varias voces, importación de EPUB y PDF, renderizado por capítulos y exportación a .m4b. El editor de guiones ocupa el espacio de trabajo principal, mientras que las asignaciones de voz y la configuración del libro permanecen en pestañas independientes, lo que facilita gestionar proyectos largos sin mezclar los ajustes de producción con la edición de texto.
Dictado y transcripción
VoiceStudio incluye un widget de dictado para todo el sistema con un atajo global, transcripción en directo y limpieza opcional mediante un LLM local. Para el reconocimiento de voz, los usuarios pueden elegir entre WhisperX, Faster-Whisper, MLX Whisper, Parakeet, Moonshine, FunASR, Sherpa-ONNX y servidores compatibles con OpenAI configurados.
WhisperX es la opción predeterminada para doblaje, subtítulos, tiempos a nivel de palabra y diarización. Los usuarios de Apple Silicon pueden utilizar MLX Whisper o Parakeet MLX, mientras que los sistemas que solo usan CPU pueden emplear Moonshine o Faster-Whisper int8 para reducir el uso de memoria.
Herramientas multimedia adicionales
La plataforma también incluye:
- Aislamiento de voces con Demucs
- Diarización de hablantes con Pyannote y WhisperX
- Colas por lotes para trabajos de audio y vídeo
- Supervisión de carpetas para detectar vídeos nuevos
- Inserción y detección de marcas de agua de IA mediante AudioSeal
- Descargas remotas de modelos para workers inscritos
- Un catálogo de modelos para instalar, eliminar y enrutar motores
Opciones de instalación
El proyecto ofrece versiones empaquetadas para macOS, Windows y Linux, además de imágenes de Docker.
| Plataforma | Paquete o requisito |
|---|---|
| macOS | Apple Silicon, macOS 13.3+, DMG |
| Windows | Windows 10/11 x64, MSI; disponible la instalación para el usuario actual |
| Linux | x86_64 con glibc 2.39+, AppImage |
| Docker | Imágenes Linux/AMD64 con perfiles de GPU CUDA, ROCm, CPU y solo worker |
En el primer inicio, VoiceStudio crea un entorno de Python gestionado y descarga el modelo predeterminado. Los inicios posteriores reutilizan ese entorno y la caché de modelos.
En Docker, las imágenes publicadas son solo linux/amd64:
docker run -d \\
-p 127.0.0.1:3900:3900 \\
-v omnivoice-data:/app/omnivoice_data \\
--name voicestudio \\
palashdeb/omnivoice-studio:stable
Los usuarios de Apple Silicon deberían utilizar normalmente la aplicación nativa de macOS para la aceleración de GPU. Los hosts ARM64 deben verificar los requisitos de arquitectura antes de descargar una imagen de contenedor.
Ejecución desde el código fuente
El desarrollo requiere Node 20 o posterior, Bun y Python 3.11 o posterior:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
El lanzador de escritorio configura automáticamente las dependencias de Python mediante uv. Para ejecutar la interfaz web en su lugar:
bun run dev
Si el inicio falla, ejecuta los diagnósticos integrados desde Settings → About → Run self-check, o ejecuta:
uv run python backend/main.py --diagnose --deep
Hardware y selección de motores
VoiceStudio admite el funcionamiento con CPU, pero una GPU puede mejorar considerablemente la velocidad de generación. El proyecto indica estos requisitos básicos para su flujo de trabajo local predeterminado:
| Recurso | Mínimo | Recomendado |
|---|---|---|
| RAM | 8 GB | 16 GB o más |
| Espacio libre en disco | 10 GB | 20 GB o más en un SSD |
| VRAM | 4 GB para usar GPU | 8 GB o más |
| Python | 3.11+ | 3.11 o 3.12 |
Los motores opcionales grandes pueden requerir 12–16 GB de VRAM o más. ROCm es exclusivo de Linux y opcional; los sistemas Windows con AMD/Ryzen AI utilizan inferencia en CPU. Los sistemas con VRAM limitada pueden trasladar parte del trabajo a la CPU.
Las combinaciones recomendadas incluyen:
- Apple Silicon M1–M4: MLX-Audio u OmniVoice con MPS; MLX Whisper o Parakeet MLX para ASR.
- GPU NVIDIA con 8 GB o más de VRAM: OmniVoice o CosyVoice 3; WhisperX para transcripción y diarización.
- VRAM limitada o solo CPU: PocketTTS, Sherpa-ONNX o KittenTTS; Moonshine o Faster-Whisper int8 para ASR.
El catálogo de motores incluye OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, MOSS-TTS, KittenTTS, MLX-Audio, Sherpa-ONNX, IndexTTS, PocketTTS, Supertonic, dots.tts y Confucius4-TTS. Sus capacidades difieren considerablemente: algunos admiten clonación y síntesis basada en instrucciones, mientras que otros están centrados en CPU o limitados a determinados idiomas.
Verifica siempre la cobertura lingüística, la compatibilidad de plataforma, los requisitos de memoria, la capacidad de clonación y la licencia del modelo antes de utilizar un motor en producción.
API local y compatibilidad con OpenAI
La aplicación de escritorio se comunica con un backend FastAPI enlazado a localhost:3900. El backend expone REST, Server-Sent Events, WebSockets, una API de audio compatible con OpenAI y un servidor MCP.
Cambia la URL base de un cliente OpenAI para apuntar al backend local:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3900/v1",
api_key="local",
)
with client.audio.speech.with_streaming_response.create(
model="tts-1",
voice="<profile-id>",
input="Made on my own hardware.",
response_format="wav",
) as response:
response.stream_to_file("speech.wav")
Una solicitud cURL es igual de sencilla:
curl http://localhost:3900/v1/audio/speech \\
-H "Content-Type: application/json" \\
-d '{
"model": "tts-1",
"input": "Made on my own hardware.",
"voice": "default",
"response_format": "wav"
}' \\
--output speech.wav
Entre los endpoints importantes se incluyen:
POST /v1/audio/speech— genera audio en MP3, Opus, AAC, FLAC, WAV o PCM.POST /v1/audio/transcriptions— devuelve JSON, texto, JSON detallado, SRT o VTT.WS /v1/audio/transcriptions/stream— transmite eventos parciales y finales de transcripción.GET /v1/audio/voices— enumera perfiles de voz y motores locales.GET /.well-known/voicestudio-speech— descubre los transportes de voz disponibles.
Las llamadas de bucle local no requieren una clave del servidor. El acceso remoto requiere un PIN de uso compartido o una clave API, y las implementaciones en LAN, Tailscale o mediante proxy deben seguir las indicaciones de autenticación del proyecto.
Integraciones con MCP y agentes
VoiceStudio incluye un servidor MCP en http://localhost:3900/mcp, que permite a Claude Desktop, Cursor y otros clientes MCP invocar herramientas de síntesis y transcripción.
{
"mcpServers": {
"voicestudio": {
"url": "http://localhost:3900/mcp"
}
}
}
Para los clientes que requieren transporte stdio, el repositorio incluye un adaptador local:
{
"mcpServers": {
"voicestudio": {
"command": "python",
"args": ["-m", "backend.mcp_shim"],
"cwd": "/path/to/VoiceStudio"
}
}
}
Las herramientas MCP incluyen generate_speech, clone_voice y transcribe, con compatibilidad con modos de transmisión de archivos y bindings de cliente. Las habilidades del proyecto para Claude Code, Codex, Cursor y agentes compatibles pueden instalarse con:
npx skills add debpalash/VoiceStudio
Privacidad, seguridad y licencias
El flujo de trabajo de escritorio predeterminado mantiene las grabaciones, transcripciones, voces, proyectos, ajustes y resultados en el equipo local. Los workers remotos y los endpoints ASR compatibles con OpenAI requieren una activación explícita. Los endpoints que no sean de bucle local requieren HTTPS y no se siguen las redirecciones.
La analítica está desactivada hasta obtener el consentimiento. Si se activa, envía metadatos de uso permitidos y sin contenido —no texto, audio, nombres de archivo ni datos de proyectos—.
VoiceStudio está licenciado bajo AGPL-3.0. Puedes ejecutarlo, modificarlo y utilizarlo internamente. Si modificas la aplicación y la proporcionas como servicio de red, las obligaciones de AGPL exigen ofrecer el código fuente correspondiente bajo la misma licencia. Existe una licencia comercial para la integración propietaria del código propio de VoiceStudio, pero no relicencia los modelos de terceros.
Los términos de los modelos y tokenizadores son independientes. Por ejemplo, la configuración predeterminada de OmniVoice incluye pesos preentrenados etiquetados como CC-BY-NC y un tokenizador de audio con términos adicionales de sus proyectos de origen. La licencia de la aplicación no concede automáticamente derechos comerciales sobre todos los modelos descargados.
El proyecto también integra de forma predeterminada la marca de agua AudioSeal para ayudar a detectar e identificar voz sintética sin modificar su calidad audible.
¿Quién debería utilizarlo?
VoiceStudio es una buena opción cuando necesitas:
- Generación de voz privada o sin conexión
- Síntesis de gran volumen sin cargos por solicitud
- Clonación de voz local y doblaje multilingüe
- Un flujo de trabajo de escritorio junto con APIs programables
- Múltiples motores TTS y ASR en una sola aplicación
- Integración con agentes de programación mediante MCP
- Control sobre el enrutamiento de modelos, el hardware y el almacenamiento
Es menos adecuado si quieres un escalado en la nube sin configuración, no dispones de suficiente almacenamiento o capacidad de cómputo local, o necesitas un único proveedor con licencias comerciales unificadas para todos los modelos.
Con 26,9 mil estrellas en GitHub, 3,3 mil forks, 38 versiones y un historial de desarrollo activo, VoiceStudio ha crecido más allá de una simple demostración de clonación de voz. Su combinación de herramientas de escritorio, APIs locales, enrutamiento de modelos, flujos de doblaje e integraciones con agentes lo convierte en una base práctica para desarrolladores que crean aplicaciones de voz privadas en su propio hardware.