AIBit-Découvrez des projets open source AIBit-Découvrez des projets open source
Projets Open SourceWeb Scraping & DonnéesAgents IA & AutomatisationOutils et ressources IA
Plus
Apprentissage et tutorielsRecherche et benchmarks IADéveloppement et SécuritéWeb & InfrastructureMédias et création de contenuMatériel et Edge AIRessources pour startups
AIBit-Découvrez des projets open source › Outils et ressources IA› IA Voix & Audio

14 août 2026

HOT-Step CPP : Génération de musique IA locale avec C++ et GGML

Générez de la musique stéréo 48 kHz localement avec HOT-Step CPP, une interface C++/GGML riche en fonctionnalités pour ACE-Step, outils audio, plugins et entraînement de modèles.

  • 2 août 2026

    Inflect v2 : TTS local texte-vers-forme d'onde à 3,96 M et 9,36 M de paramètres

    Inflect v2 offre un TTS anglais complet à 24 kHz dans deux modèles compacts (3,96 M et 9,36 M de paramètres) sans vocodeur externe. Explorez l'architecture, l'évaluation et le déploiement sur CPU.

  • 2 août 2026

    KittenTTS : Synthèse vocale de pointe en moins de 25 Mo fonctionnant sur CPU

    KittenTTS offre une synthèse vocale de haute qualité avec des modèles aussi petits que 25 Mo, fonctionnant entièrement sur CPU. Découvrez comment l'utiliser, son API et pourquoi elle compte pour l'IA en périphérie.

  • 30 juil. 2026

    CrispASR : Un binaire C++ pour 53 modèles ASR et 51 modèles TTS

    CrispASR est un moteur vocal C++ unifié basé sur ggml, prenant en charge 53 modèles ASR et 51 modèles TTS sans dépendance Python. Exécutez Cohere Transcribe, Parakeet, Voxtral, Qwen3 et bien d'autres à partir d'une seule interface en ligne de commande.

  • 22 juil. 2026

    FluidAudio : Exécutez les modèles audio IA de pointe localement sur les appareils Apple avec CoreML

    FluidAudio est un SDK Swift permettant d'exécuter des modèles de pointe de reconnaissance vocale, synthèse vocale, diarisation des locuteurs et détection d'activité vocale entièrement sur l'appareil grâce au Neural Engine d'Apple. Cet article explore ses capacités, son architecture et comment l'intégrer dans vos applications.

  • 22 juil. 2026

    SpeechRecognition : Une bibliothèque Python complète pour la reconnaissance vocale

    Découvrez SpeechRecognition, une bibliothèque Python polyvalente prenant en charge plusieurs moteurs et API de reconnaissance vocale, en ligne et hors ligne, avec des exemples pratiques et des conseils de dépannage.

  • 11 juil. 2026

    Speech Swift : Kit vocal IA sur appareil pour Apple Silicon

    Découvrez Speech Swift, un kit open source pour la reconnaissance vocale, la synthèse vocale, la traduction parole-à-parole, la détection d'activité vocale et la diarisation sur Apple Silicon avec MLX et CoreML.

  • 6 juin 2026

    Miso TTS 8B : Un modèle de synthèse vocale open-source de haute qualité

    Miso TTS 8B est un modèle de synthèse vocale open-source de pointe avec 8 milliards de paramètres, offrant une génération vocale très émotive et des capacités de clonage vocal.

  • 24 mai 2026

    Voice-Pro : Une suite audio et de doublage IA tout-en-un open-source

    Voice-Pro est une puissante WebUI open-source basée sur Gradio qui intègre des outils de pointe de clonage vocal, de transcription et de traduction en un seul flux de travail.

  • 21 mai 2026

    OpenLess : L'outil de saisie vocale IA open-source pour les développeurs

    Arrêtez de taper, commencez à parler. OpenLess est un outil multiplateforme axé sur la confidentialité qui transforme votre voix en texte structuré et optimisé par l'IA, directement à l'emplacement de votre curseur.

  • 14 mai 2026

    Supertonic : synthèse vocale multilingue ultra-rapide sur l'appareil

    Découvrez Supertonic, un système de synthèse vocale open-source puissant qui apporte une synthèse vocale multilingue de haute qualité directement sur votre appareil. En tirant parti d'ONNX Runtime, Supertonic élimine le besoin d'API cloud, garantissant une confidentialité totale et des performances quasi instantanées. Que vous soyez un développeur travaillant avec Python, C++, Rust ou des technologies web, ce moteur léger offre un support de 31 langues et une précision de lecture supérieure pour les textes complexes. Découvrez comment ce modèle de 99 millions de paramètres surpasse les alternatives plus grandes en termes de vitesse et d'efficacité, ce qui en fait le choix idéal pour l'informatique en périphérie, les applications mobiles et les projets basés sur navigateur. Explorez l'avenir de la génération vocale locale, privée et ultra-rapide dès aujourd'hui.

  • 12 avr. 2026

    VoxCPM2 : TTS multilingue 2B avec clonage et conception de voix

    Découvrez VoxCPM2, le modèle TTS sans tokenizer révolutionnaire à 2B paramètres supportant 30 langues avec un audio 48kHz de qualité studio. Créez des voix à partir de descriptions textuelles, clonez n'importe quel locuteur avec une fidélité parfaite, et atteignez des performances en temps réel (RTF 0.13 sur RTX 4090). Entièrement open-source sous Apache 2.0 avec API Python, CLI, démo web, fine-tuning LoRA et prêt pour le déploiement en production. Surpasse les modèles commerciaux sur les principaux benchmarks TTS.

Précédent 1 / 3 Suivant

Outils d'IA sélectionnés, projets open source, tutoriels et ressources pour les développeurs travaillant avec l'intelligence artificielle.

Conditions d'utilisation Politique de confidentialité © 2026 AIBit-Découvrez des projets open source