19 septembre 2026
Découvrez VoiceStudio, une alternative locale à ElevenLabs pour le clonage vocal, le doublage, la dictée, la transcription et les livres audio dans 646 langues.
YuE2 transforme des paroles et des prompts de style en partitions musicales modifiables, en chansons de qualité comparable aux modèles de pointe, en reprises zero-shot et en révisions pilotées par des agents.
VoiceStudio apporte le clonage vocal, le doublage, la dictée, la transcription et les livres audio sur votre matériel grâce à 16 moteurs TTS et 11 moteurs ASR.
StemDeck est un studio d'extraction de stems open source et local-first qui isole la voix, la batterie, la basse, la guitare et le piano, sans abonnement cloud ni téléversement de données.
Générez de la musique stéréo 48 kHz localement avec HOT-Step CPP, une interface C++/GGML riche en fonctionnalités pour ACE-Step, outils audio, plugins et entraînement de modèles.
Inflect v2 offre un TTS anglais complet à 24 kHz dans deux modèles compacts (3,96 M et 9,36 M de paramètres) sans vocodeur externe. Explorez l'architecture, l'évaluation et le déploiement sur CPU.
KittenTTS offre une synthèse vocale de haute qualité avec des modèles aussi petits que 25 Mo, fonctionnant entièrement sur CPU. Découvrez comment l'utiliser, son API et pourquoi elle compte pour l'IA en périphérie.
CrispASR est un moteur vocal C++ unifié basé sur ggml, prenant en charge 53 modèles ASR et 51 modèles TTS sans dépendance Python. Exécutez Cohere Transcribe, Parakeet, Voxtral, Qwen3 et bien d'autres à partir d'une seule interface en ligne de commande.
FluidAudio est un SDK Swift permettant d'exécuter des modèles de pointe de reconnaissance vocale, synthèse vocale, diarisation des locuteurs et détection d'activité vocale entièrement sur l'appareil grâce au Neural Engine d'Apple. Cet article explore ses capacités, son architecture et comment l'intégrer dans vos applications.
Découvrez SpeechRecognition, une bibliothèque Python polyvalente prenant en charge plusieurs moteurs et API de reconnaissance vocale, en ligne et hors ligne, avec des exemples pratiques et des conseils de dépannage.
Découvrez Speech Swift, un kit open source pour la reconnaissance vocale, la synthèse vocale, la traduction parole-à-parole, la détection d'activité vocale et la diarisation sur Apple Silicon avec MLX et CoreML.
Miso TTS 8B est un modèle de synthèse vocale open-source de pointe avec 8 milliards de paramètres, offrant une génération vocale très émotive et des capacités de clonage vocal.