AIBit - オープンソースプロジェクトの発見 AIBit - オープンソースプロジェクトの発見
オープンソースプロジェクトウェブスクレイピングとデータAIエージェントと自動化AIツール&リソース
もっと見る
学習とチュートリアルAI研究とベンチマーク開発とセキュリティウェブ & インフラストラクチャメディア&コンテンツ制作ハードウェア & エッジAIスタートアップ向けリソース
AIBit - オープンソースプロジェクトの発見 › AIツール&リソース› 音声・オーディオAI

2026年9月19日

VoiceStudio:完全ローカルで動作するオープンソースの音声AIワークベンチ

646言語に対応し、ボイスクローニング、吹き替え、ディクテーション、文字起こし、オーディオブック制作を行える、ローカル版ElevenLabs代替のVoiceStudioを紹介します。

  • 2026年9月14日

    YuE2:編集可能なスコアとAIエージェントによるオープンな音楽生成

    YuE2は、歌詞とスタイルプロンプトを編集可能な楽譜に変換し、最先端品質の楽曲、ゼロショット・カバー、エージェント主導の改訂を実現します。

  • 2026年9月14日

    VoiceStudio:完全ローカルで動作するオープンソースのElevenLabs代替

    VoiceStudioは、16種類のTTSエンジンと11種類のASRエンジンを使い、音声クローン、吹き替え、ディクテーション、文字起こし、オーディオブック制作を自分のハードウェア上で実現します。

  • 2026年8月30日

    StemDeck: DemucsとTauriを活用した無料・ローカル完結型の6トラックAI音源分離

    StemDeckは、クラウドへのサブスクリプションやアップロードを一切行わずに、ボーカル、ドラム、ベース、ギター、ピアノを分離できるオープンソースのローカルファーストなステム抽出スタジオです。

  • 2026年8月14日

    HOT-Step CPP: C++とGGMLによるローカルAI音楽生成

    HOT-Step CPPで、ステレオ48kHzの音楽をローカルに生成。ACE-Step用の高機能C++/GGMLインターフェースで、オーディオツール、プラグイン、モデルトレーニングもサポート。

  • 2026年8月2日

    Inflect v2: 3.96Mおよび9.36Mパラメータによるローカルテキストから波形へのTTS

    Inflect v2は、外部ボコーダーを必要とせず、2つのコンパクトなモデル(3.96Mおよび9.36Mパラメータ)で完全な24kHz英語TTSを提供します。アーキテクチャ、評価、CPU展開について詳しく説明します。

  • 2026年8月2日

    KittenTTS: 25MB未満でCPU上で動作する最先端TTS

    KittenTTSは、わずか25MBのモデルで高品質なテキスト読み上げを実現し、完全にCPU上で動作します。使い方、API、エッジAIにとっての重要性について学びましょう。

  • 2026年7月30日

    CrispASR: 53のASRモデルと51のTTSモデルをサポートする単一のC++バイナリ

    CrispASRは、ggml上に構築された統合C++音声エンジンで、53のASRモデルと51のTTSモデルをPython依存関係なしでサポートします。Cohere Transcribe、Parakeet、Voxtral、Qwen3などを単一のCLIから実行できます。

  • 2026年7月22日

    FluidAudio: Appleデバイス上でCoreMLを使用して最先端の音声AIモデルをローカル実行

    FluidAudioは、Apple Neural Engineを使用して、最先端の音声認識、テキスト読み上げ、話者識別、音声アクティビティ検出をすべてデバイス上で実行するためのSwift SDKです。この記事では、その機能、アーキテクチャ、およびアプリへの統合方法について説明します。

  • 2026年7月22日

    SpeechRecognition: 音声認識のための包括的なPythonライブラリ

    SpeechRecognitionを探求する。これは、複数の音声認識エンジンとAPI(オンライン・オフライン両方)をサポートする多用途なPythonライブラリであり、実用的な例とトラブルシューティングのヒントを提供します。

  • 2026年7月11日

    Speech Swift: Apple Silicon向けオンデバイスAI音声ツールキット

    MLXとCoreMLを使用してApple Silicon上でASR、TTS、音声間翻訳、VAD、話者ダイアライゼーションを実現するオープンソースツールキットSpeech Swiftを探る。

  • 2026年6月6日

    Miso TTS 8B:高品質なオープンソース音声合成モデル

    Miso TTS 8Bは、80億パラメータを備えた最先端のオープンソース音声合成モデルで、高度に感情的な音声生成と声のクローン作成機能を提供します。

前へ 1 / 4 次へ

AI開発者のための厳選されたAIツール、オープンソースプロジェクト、チュートリアル、リソース集。

利用規約 プライバシーポリシー © 2026 AIBit - オープンソースプロジェクトの発見