AIBit - オープンソースプロジェクトの発見 AIBit - オープンソースプロジェクトの発見
オープンソースプロジェクトウェブスクレイピングとデータAIエージェントと自動化AIツール&リソース
もっと見る
学習とチュートリアルAI研究とベンチマーク開発とセキュリティウェブ & インフラストラクチャメディア&コンテンツ制作ハードウェア & エッジAIスタートアップ向けリソース
AIBit - オープンソースプロジェクトの発見 › AIツール&リソース› 音声・オーディオAI

2026年8月14日

HOT-Step CPP: C++とGGMLによるローカルAI音楽生成

HOT-Step CPPで、ステレオ48kHzの音楽をローカルに生成。ACE-Step用の高機能C++/GGMLインターフェースで、オーディオツール、プラグイン、モデルトレーニングもサポート。

  • 2026年8月2日

    Inflect v2: 3.96Mおよび9.36Mパラメータによるローカルテキストから波形へのTTS

    Inflect v2は、外部ボコーダーを必要とせず、2つのコンパクトなモデル(3.96Mおよび9.36Mパラメータ)で完全な24kHz英語TTSを提供します。アーキテクチャ、評価、CPU展開について詳しく説明します。

  • 2026年8月2日

    KittenTTS: 25MB未満でCPU上で動作する最先端TTS

    KittenTTSは、わずか25MBのモデルで高品質なテキスト読み上げを実現し、完全にCPU上で動作します。使い方、API、エッジAIにとっての重要性について学びましょう。

  • 2026年7月30日

    CrispASR: 53のASRモデルと51のTTSモデルをサポートする単一のC++バイナリ

    CrispASRは、ggml上に構築された統合C++音声エンジンで、53のASRモデルと51のTTSモデルをPython依存関係なしでサポートします。Cohere Transcribe、Parakeet、Voxtral、Qwen3などを単一のCLIから実行できます。

  • 2026年7月22日

    FluidAudio: Appleデバイス上でCoreMLを使用して最先端の音声AIモデルをローカル実行

    FluidAudioは、Apple Neural Engineを使用して、最先端の音声認識、テキスト読み上げ、話者識別、音声アクティビティ検出をすべてデバイス上で実行するためのSwift SDKです。この記事では、その機能、アーキテクチャ、およびアプリへの統合方法について説明します。

  • 2026年7月22日

    SpeechRecognition: 音声認識のための包括的なPythonライブラリ

    SpeechRecognitionを探求する。これは、複数の音声認識エンジンとAPI(オンライン・オフライン両方)をサポートする多用途なPythonライブラリであり、実用的な例とトラブルシューティングのヒントを提供します。

  • 2026年7月11日

    Speech Swift: Apple Silicon向けオンデバイスAI音声ツールキット

    MLXとCoreMLを使用してApple Silicon上でASR、TTS、音声間翻訳、VAD、話者ダイアライゼーションを実現するオープンソースツールキットSpeech Swiftを探る。

  • 2026年6月6日

    Miso TTS 8B:高品質なオープンソース音声合成モデル

    Miso TTS 8Bは、80億パラメータを備えた最先端のオープンソース音声合成モデルで、高度に感情的な音声生成と声のクローン作成機能を提供します。

  • 2026年5月24日

    Voice-Pro: オープンソースのオールインワンAIオーディオ&ダビングスイート

    Voice-Proは、最先端の音声クローン、文字起こし、翻訳ツールを1つのワークフローに統合した、強力なオープンソースのGradioベースWebUIです。

  • 2026年5月21日

    OpenLess: 開発者向けのオープンソースAI音声入力ツール

    タイピングをやめて、話そう。OpenLessは、あなたの声をAIで構造化・洗練されたテキストに変換し、カーソル位置に直接出力する、プライバシー重視のクロスプラットフォームツールです。

  • 2026年5月14日

    Supertonic: 超高速・オンデバイス多言語TTS

    Supertonicは、高品質な多言語音声合成をデバイス上で直接実現する、強力なオープンソースの音声合成システムです。ONNX Runtimeを活用することで、SupertonicはクラウドAPIの必要性を排除し、完全なプライバシーとほぼ瞬時のパフォーマンスを保証します。Python、C++、Rust、またはWeb技術を使用する開発者にとって、この軽量エンジンは31言語のサポートと、複雑なテキストに対する優れた読み上げ精度を提供します。この99Mパラメータのモデルが、いかにして速度と効率の面で大規模な代替モデルを凌駕しているかを確認してください。エッジコンピューティング、モバイルアプリ、ブラウザベースのプロジェクトに最適な選択肢です。ローカルでプライベート、かつ超高速な音声生成の未来を今すぐ体験してください。

  • 2026年4月12日

    VoxCPM2:音声クローニング&デザイン対応の2B多言語TTS

    VoxCPM2を発見してください。画期的な2Bパラメータのトークナイザー不要TTSモデルで、30言語対応、スタジオ品質48kHzオーディオ。テキスト記述から声を生成、完璧な精度で任意のスピーカーをクローニング、リアルタイム性能(RTX 4090でRTF 0.13)を達成。Apache 2.0の完全オープンソースでPython API、CLI、Webデモ、LoRAファインチューニング、本番展開準備完了。主要TTSベンチマークで商用モデルを上回ります。

前へ 1 / 3 次へ

AI開発者のための厳選されたAIツール、オープンソースプロジェクト、チュートリアル、リソース集。

利用規約 プライバシーポリシー © 2026 AIBit - オープンソースプロジェクトの発見