14 août 2026
Générez de la musique stéréo 48 kHz localement avec HOT-Step CPP, une interface C++/GGML riche en fonctionnalités pour ACE-Step, outils audio, plugins et entraînement de modèles.
Inflect v2 offre un TTS anglais complet à 24 kHz dans deux modèles compacts (3,96 M et 9,36 M de paramètres) sans vocodeur externe. Explorez l'architecture, l'évaluation et le déploiement sur CPU.
KittenTTS offre une synthèse vocale de haute qualité avec des modèles aussi petits que 25 Mo, fonctionnant entièrement sur CPU. Découvrez comment l'utiliser, son API et pourquoi elle compte pour l'IA en périphérie.
CrispASR est un moteur vocal C++ unifié basé sur ggml, prenant en charge 53 modèles ASR et 51 modèles TTS sans dépendance Python. Exécutez Cohere Transcribe, Parakeet, Voxtral, Qwen3 et bien d'autres à partir d'une seule interface en ligne de commande.
FluidAudio est un SDK Swift permettant d'exécuter des modèles de pointe de reconnaissance vocale, synthèse vocale, diarisation des locuteurs et détection d'activité vocale entièrement sur l'appareil grâce au Neural Engine d'Apple. Cet article explore ses capacités, son architecture et comment l'intégrer dans vos applications.
Découvrez SpeechRecognition, une bibliothèque Python polyvalente prenant en charge plusieurs moteurs et API de reconnaissance vocale, en ligne et hors ligne, avec des exemples pratiques et des conseils de dépannage.
Découvrez Speech Swift, un kit open source pour la reconnaissance vocale, la synthèse vocale, la traduction parole-à-parole, la détection d'activité vocale et la diarisation sur Apple Silicon avec MLX et CoreML.
Miso TTS 8B est un modèle de synthèse vocale open-source de pointe avec 8 milliards de paramètres, offrant une génération vocale très émotive et des capacités de clonage vocal.
Voice-Pro est une puissante WebUI open-source basée sur Gradio qui intègre des outils de pointe de clonage vocal, de transcription et de traduction en un seul flux de travail.
Arrêtez de taper, commencez à parler. OpenLess est un outil multiplateforme axé sur la confidentialité qui transforme votre voix en texte structuré et optimisé par l'IA, directement à l'emplacement de votre curseur.
Découvrez Supertonic, un système de synthèse vocale open-source puissant qui apporte une synthèse vocale multilingue de haute qualité directement sur votre appareil. En tirant parti d'ONNX Runtime, Supertonic élimine le besoin d'API cloud, garantissant une confidentialité totale et des performances quasi instantanées. Que vous soyez un développeur travaillant avec Python, C++, Rust ou des technologies web, ce moteur léger offre un support de 31 langues et une précision de lecture supérieure pour les textes complexes. Découvrez comment ce modèle de 99 millions de paramètres surpasse les alternatives plus grandes en termes de vitesse et d'efficacité, ce qui en fait le choix idéal pour l'informatique en périphérie, les applications mobiles et les projets basés sur navigateur. Explorez l'avenir de la génération vocale locale, privée et ultra-rapide dès aujourd'hui.
Découvrez VoxCPM2, le modèle TTS sans tokenizer révolutionnaire à 2B paramètres supportant 30 langues avec un audio 48kHz de qualité studio. Créez des voix à partir de descriptions textuelles, clonez n'importe quel locuteur avec une fidélité parfaite, et atteignez des performances en temps réel (RTF 0.13 sur RTX 4090). Entièrement open-source sous Apache 2.0 avec API Python, CLI, démo web, fine-tuning LoRA et prêt pour le déploiement en production. Surpasse les modèles commerciaux sur les principaux benchmarks TTS.