VoiceStudio: Un banco de trabajo de IA de voz totalmente local y de código abierto

Descubre VoiceStudio, una alternativa local a ElevenLabs para clonación de voz, doblaje, dictado, transcripción y audiolibros en 646 idiomas.

VoiceStudio: Un banco de trabajo de IA de voz totalmente local y de código abierto

Las plataformas de voz en la nube son prácticas, pero implican concesiones relacionadas con la privacidad, los costes recurrentes, la dependencia de la red y el control sobre tus datos. VoiceStudio adopta un enfoque diferente: es un motor de flujos de trabajo de voz y una aplicación de escritorio de código abierto, diseñada para ejecutar la generación de voz y tareas multimedia relacionadas en tu propio hardware.

El proyecto se presenta como una alternativa totalmente local a ElevenLabs, combinando clonación de voz, diseño de voz, doblaje de vídeo, dictado, transcripción, producción de audiolibros y automatización en un único espacio de trabajo. Admite flujos de trabajo en 646 idiomas, y permite elegir entre varios motores de voz en lugar de quedar vinculado a un único proveedor.

Qué hace VoiceStudio

VoiceStudio es más que una demostración de texto a voz. Sus espacios de trabajo están organizados en torno al flujo completo de producción:

  • Clonación de voz: Genera voz a partir de una grabación de referencia limpia y autorizada.
  • Diseño de voz: Describe la voz que quieres y crea una voz adecuada sin partir de un hablante existente.
  • Doblaje de vídeo: Produce voz traducida sincronizada para contenido de vídeo.
  • Dictado: Usa un widget flotante para convertir voz en texto.
  • Transcripción: Procesa audio grabado localmente.
  • Historias y audiolibros: Crea contenido narrado de formato largo y trabajos por lotes.
  • API local y MCP: Conecta los flujos de trabajo de voz con scripts, agentes de programación y otros sistemas de automatización.
  • Trabajadores remotos opcionales: Delega el procesamiento en trabajadores remotos con GPU cuando el hardware local no es suficiente.

La configuración predeterminada utiliza k2-fsa/OmniVoice, pero VoiceStudio incluye un catálogo de motores para que los usuarios seleccionen otro backend compatible. Esta separación entre la capa de flujo de trabajo y el motor de voz es importante: permite que la aplicación ofrezca una interfaz coherente mientras el soporte de hardware, la calidad, la velocidad y la cobertura de idiomas varían según el motor.

Arquitectura local por defecto

El principio de diseño principal de VoiceStudio es que los flujos de trabajo locales se ejecutan en tu propio ordenador. Los servicios remotos son opcionales y los análisis de uso requieren consentimiento. Esto hace que el proyecto sea útil para desarrolladores que trabajan con grabaciones privadas, documentación interna, guiones inéditos o datos de clientes que no deberían subirse a una API de terceros.

El procesamiento local también cambia la economía de la generación repetida. Una vez instalados los modelos y las dependencias, producir audio adicional no requiere pagar una API por carácter. La contrapartida es que debes proporcionar suficiente CPU, RAM, almacenamiento y, posiblemente, memoria de GPU para el motor seleccionado. Los requisitos de hardware varían, por lo que el proyecto recomienda consultar su documentación de rendimiento en lugar de asumir que se utilizará automáticamente una GPU.

VoiceStudio también puede exponer un backend local para uso programático. El endpoint de estado predeterminado es:

http://localhost:3900/health

Después de iniciar el backend, la documentación de API generada puede consultarse en:

http://localhost:3900/openapi.json

Esto permite crear integraciones reproducibles en lugar de manejar manualmente la interfaz gráfica.

Aplicación de escritorio y migración a Electron

La aplicación de Electron es ahora la experiencia de escritorio principal. La versión 0.5.3 introdujo Electron y fue la última versión de Tauri. Los usuarios actuales de Tauri deben instalar la aplicación de Electron por separado; ambos entornos no deben considerarse una migración automática en el mismo lugar.

La interfaz de escritorio incluye pantallas específicas para clonación de voz, doblaje, diseño de voz y gestión de modelos locales. El gestor de modelos resulta especialmente útil para mantener separadas la configuración y la producción: los usuarios pueden instalar el modelo necesario cuando se les solicite, consultar los motores disponibles y reutilizar los recursos descargados en distintos flujos de trabajo.

El proyecto también ofrece guías de instalación específicas para:

  • macOS
  • Windows
  • Linux
  • Docker

Para quienes prefieren una configuración automatizada, VoiceStudio incluye instrucciones de instalación orientadas a agentes. Un agente de programación puede inspeccionar el sistema operativo, la arquitectura de la CPU, la GPU, la RAM, la VRAM, el espacio libre en disco y la instalación existente de VoiceStudio antes de elegir una configuración compatible. Este enfoque es práctico porque los modelos de voz pueden ser grandes, y descargar un modelo a ciegas o seleccionar un backend de aceleración no compatible suele provocar instalaciones fallidas.

Ejecutar VoiceStudio desde el código fuente

Para iniciar la vista previa de Electron desde el código fuente, clona el repositorio e instala sus dependencias de JavaScript con Bun:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run dev

El repositorio combina varias tecnologías. Su implementación está escrita principalmente en Python, JavaScript y TypeScript, con Rust para los componentes nativos y pequeñas partes escritas en CSS y scripts de shell. El árbol incluye directorios independientes para backend, frontend, Electron, puente de escritorio nativo, despliegue, ejemplos, notebooks, pruebas y modelos.

Antes de ejecutar el proyecto desde el código fuente, consulta la documentación de configuración de Electron para conocer los requisitos previos y la configuración del backend. Para una instalación empaquetada, el proyecto recomienda descargar el instalador estable más reciente para el sistema operativo y la arquitectura de destino.

Un flujo de trabajo inicial práctico

Una primera prueba sensata debe ser deliberadamente pequeña:

  1. Instala VoiceStudio siguiendo la guía de tu plataforma.
  2. Abre el espacio de trabajo de clonación de voz.
  3. Selecciona la voz de demostración incluida o añade una grabación de referencia autorizada y limpia.
  4. Introduce una frase de prueba breve.
  5. Instala el modelo necesario cuando se te solicite.
  6. Confirma qué dispositivo de ejecución se está utilizando realmente.
  7. Genera un archivo de audio y verifica la ruta de salida.

Comprobar el dispositivo de ejecución real es importante. Una máquina puede tener una GPU instalada y aun así ejecutar la inferencia en la CPU debido a un entorno de ejecución incompatible, una biblioteca de aceleración ausente o un modelo no compatible. Registrar el motor seleccionado, el dispositivo real, la ubicación del modelo y la ruta del audio generado facilita mucho la resolución de problemas en el futuro.

Para la automatización, el repositorio también publica habilidades de agente instalables:

npx skills add debpalash/VoiceStudio

La habilidad voicestudio se centra en los flujos de trabajo de audio, mientras que voicestudio-maintainer está destinada al mantenimiento del repositorio. Si un agente no admite la instalación de habilidades, se pueden seguir directamente los archivos SKILL.md correspondientes.

Privacidad, licencias y uso responsable

La clonación de voz tiene implicaciones evidentes relacionadas con el consentimiento y la identidad. VoiceStudio está bajo la licencia AGPL-3.0, mientras que cada modelo puede tener licencias independientes. Revisa ambas antes de utilizar audio generado con fines comerciales o distribuir una versión modificada del software.

Sobre todo, clona voces únicamente con permiso. Un flujo de trabajo local mejora el control de los datos, pero no elimina la responsabilidad ética o legal asociada con la suplantación, la divulgación y los derechos de imagen. Mantén seguras las grabaciones de referencia, evita utilizar voces sin autorización y etiqueta claramente la voz sintética o traducida cuando corresponda.

¿Quién debería usar VoiceStudio?

VoiceStudio es una opción adecuada para desarrolladores y creadores que quieren una infraestructura de voz autohospedada en lugar de una única llamada a una API. Resulta especialmente relevante para:

  • Transcripción y dictado sensibles a la privacidad
  • Flujos de producción de audiolibros y narraciones
  • Doblaje de vídeo multilingüe
  • Entornos sin conexión o con redes poco fiables
  • Aplicaciones de IA con enfoque local
  • Automatización de audio dirigida por agentes
  • Equipos que necesitan una generación de voz repetible y programable

Con más de 32.000 estrellas en GitHub, aproximadamente 3.900 forks, 79 colaboradores y 39 versiones publicadas en el repositorio, VoiceStudio ha evolucionado hasta convertirse en un proyecto de código abierto considerable, en lugar de una pequeña prueba de concepto. Su combinación de interfaz de escritorio, modelos locales, acceso mediante API, compatibilidad con MCP y trabajadores remotos opcionales ofrece a los desarrolladores varias formas de adoptarlo: desde una única generación manual de voz hasta un flujo de producción automatizado.

Fuente

debpalash/VoiceStudio: VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.