AIBit-Descubre proyectos de código abierto AIBit-Descubre proyectos de código abierto
Proyectos de código abiertoWeb Scraping y DatosAgentes de IA y AutomatizaciónHerramientas y recursos de IA
Más
Aprendizaje y tutorialesInvestigación y Benchmarks de IADesarrollo y SeguridadWeb e InfraestructuraCreación de Medios y ContenidoHardware e IA en el bordeRecursos para Startups
AIBit-Descubre proyectos de código abierto › Herramientas y recursos de IA› IA de Voz y Audio

14 de agosto de 2026

HOT-Step CPP: Generación local de música con IA mediante C++ y GGML

Genera música estéreo a 48 kHz localmente con HOT-Step CPP, una interfaz de C++/GGML repleta de funciones para ACE-Step, herramientas de audio, complementos y entrenamiento de modelos.

  • 2 ago 2026

    Inflect v2: TTS local de texto a forma de onda con 3.96M y 9.36M de parámetros

    Inflect v2 ofrece TTS completo en inglés de 24 kHz en dos modelos compactos (3.96M y 9.36M de parámetros) sin vocoder externo. Explore la arquitectura, la evaluación y la implementación en CPU.

  • 2 ago 2026

    KittenTTS: TTS de última generación en menos de 25MB que funciona en CPU

    KittenTTS ofrece síntesis de voz de alta calidad en modelos de solo 25MB, funcionando completamente en CPU. Aprende a usarlo, su API y por qué es importante para la IA en el borde.

  • 30 jul 2026

    CrispASR: Un solo binario C++ para 53 modelos ASR y 51 modelos TTS

    CrispASR es un motor de voz unificado en C++ construido sobre ggml, compatible con 53 modelos ASR y 51 modelos TTS sin dependencias de Python. Ejecuta Cohere Transcribe, Parakeet, Voxtral, Qwen3 y más desde una única CLI.

  • 22 jul 2026

    FluidAudio: Ejecuta Modelos de Audio AI de Última Generación Localmente en Dispositivos Apple con CoreML

    FluidAudio es un SDK de Swift para ejecutar reconocimiento de voz, síntesis de texto a voz, diarización de hablantes y detección de actividad de voz completamente en el dispositivo utilizando el Neural Engine de Apple. Este artículo explora sus capacidades, arquitectura y cómo integrarlo en tus aplicaciones.

  • 22 jul 2026

    SpeechRecognition: Una biblioteca integral de Python para conversión de voz a texto

    Explora SpeechRecognition, una biblioteca versátil de Python que admite múltiples motores y API de reconocimiento de voz, tanto en línea como fuera de línea, con ejemplos prácticos y consejos para solucionar problemas.

  • 11 jul 2026

    Speech Swift: Kit de herramientas de voz en el dispositivo para Apple Silicon

    Explora Speech Swift, un kit de herramientas de código abierto para ASR, TTS, voz a voz, VAD y diarización en Apple Silicon usando MLX y CoreML.

  • 6 jun 2026

    Miso TTS 8B: Un modelo de texto a voz de alta calidad y código abierto

    Miso TTS 8B es un modelo de texto a voz de última generación y código abierto con 8 mil millones de parámetros, que ofrece generación de voz altamente emotiva y capacidades de clonación de voz.

  • 24 may 2026

    Voice-Pro: Una Suite Integral de IA de Audio y Doblaje de Código Abierto

    Voice-Pro es una potente WebUI basada en Gradio y de código abierto que integra herramientas de vanguardia para clonación de voz, transcripción y traducción en un solo flujo de trabajo.

  • 21 may 2026

    OpenLess: La herramienta de entrada de voz con IA de código abierto para desarrolladores

    Deja de escribir, empieza a hablar. OpenLess es una herramienta multiplataforma centrada en la privacidad que convierte tu voz en texto estructurado y pulido por IA directamente donde se encuentre tu cursor.

  • 14 may 2026

    Supertonic: TTS multilingüe ultrarrápido y en el dispositivo

    Descubra Supertonic, un potente sistema de texto a voz de código abierto que lleva la síntesis de voz multilingüe de alta calidad directamente a su dispositivo. Al aprovechar ONNX Runtime, Supertonic elimina la necesidad de API en la nube, garantizando una privacidad total y un rendimiento casi instantáneo. Tanto si es un desarrollador que trabaja con Python, C++, Rust o tecnologías web, este motor ligero ofrece soporte para 31 idiomas y una precisión de lectura superior para textos complejos. Aprenda cómo este modelo de 99 millones de parámetros supera a alternativas más grandes en velocidad y eficiencia, lo que lo convierte en la elección perfecta para la computación en el borde, aplicaciones móviles y proyectos basados en navegador. Explore el futuro de la generación de voz local, privada y ultrarrápida hoy mismo.

  • 12 abr 2026

    VoxCPM2: TTS multilingüe de 2B con clonación y diseño de voz

    Descubre VoxCPM2, el innovador modelo TTS sin tokenizador de 2B parámetros que soporta 30 idiomas con audio de calidad de estudio a 48kHz. Crea voces desde descripciones de texto, clona cualquier hablante con fidelidad perfecta y logra rendimiento en tiempo real (RTF 0.13 en RTX 4090). Totalmente de código abierto bajo Apache 2.0 con API de Python, CLI, demo web, ajuste fino LoRA y listo para despliegue en producción. Supera a modelos comerciales en benchmarks TTS principales.

Anterior 1 / 3 Siguiente

Herramientas de IA, proyectos de código abierto, tutoriales y recursos seleccionados para desarrolladores que trabajan con inteligencia artificial.

Términos de servicio Política de privacidad © 2026 AIBit-Descubre proyectos de código abierto