19 de septiembre de 2026
Descubre VoiceStudio, una alternativa local a ElevenLabs para clonación de voz, doblaje, dictado, transcripción y audiolibros en 646 idiomas.
YuE2 convierte letras y prompts de estilo en partituras musicales editables, canciones de calidad puntera, versiones cover zero-shot y revisiones dirigidas por agentes.
VoiceStudio incorpora clonación de voz, doblaje, dictado, transcripción y audiolibros a tu propio hardware con 16 motores de TTS y 11 de ASR.
StemDeck es un estudio de extracción de pistas (stems) de código abierto y enfoque local que aísla voz, batería, bajo, guitarra y piano sin suscripciones en la nube ni subida de archivos.
Genera música estéreo a 48 kHz localmente con HOT-Step CPP, una interfaz de C++/GGML repleta de funciones para ACE-Step, herramientas de audio, complementos y entrenamiento de modelos.
Inflect v2 ofrece TTS completo en inglés de 24 kHz en dos modelos compactos (3.96M y 9.36M de parámetros) sin vocoder externo. Explore la arquitectura, la evaluación y la implementación en CPU.
KittenTTS ofrece síntesis de voz de alta calidad en modelos de solo 25MB, funcionando completamente en CPU. Aprende a usarlo, su API y por qué es importante para la IA en el borde.
CrispASR es un motor de voz unificado en C++ construido sobre ggml, compatible con 53 modelos ASR y 51 modelos TTS sin dependencias de Python. Ejecuta Cohere Transcribe, Parakeet, Voxtral, Qwen3 y más desde una única CLI.
FluidAudio es un SDK de Swift para ejecutar reconocimiento de voz, síntesis de texto a voz, diarización de hablantes y detección de actividad de voz completamente en el dispositivo utilizando el Neural Engine de Apple. Este artículo explora sus capacidades, arquitectura y cómo integrarlo en tus aplicaciones.
Explora SpeechRecognition, una biblioteca versátil de Python que admite múltiples motores y API de reconocimiento de voz, tanto en línea como fuera de línea, con ejemplos prácticos y consejos para solucionar problemas.
Explora Speech Swift, un kit de herramientas de código abierto para ASR, TTS, voz a voz, VAD y diarización en Apple Silicon usando MLX y CoreML.
Miso TTS 8B es un modelo de texto a voz de última generación y código abierto con 8 mil millones de parámetros, que ofrece generación de voz altamente emotiva y capacidades de clonación de voz.