2026年9月19日
646言語に対応し、ボイスクローニング、吹き替え、ディクテーション、文字起こし、オーディオブック制作を行える、ローカル版ElevenLabs代替のVoiceStudioを紹介します。
YuE2は、歌詞とスタイルプロンプトを編集可能な楽譜に変換し、最先端品質の楽曲、ゼロショット・カバー、エージェント主導の改訂を実現します。
VoiceStudioは、16種類のTTSエンジンと11種類のASRエンジンを使い、音声クローン、吹き替え、ディクテーション、文字起こし、オーディオブック制作を自分のハードウェア上で実現します。
StemDeckは、クラウドへのサブスクリプションやアップロードを一切行わずに、ボーカル、ドラム、ベース、ギター、ピアノを分離できるオープンソースのローカルファーストなステム抽出スタジオです。
HOT-Step CPPで、ステレオ48kHzの音楽をローカルに生成。ACE-Step用の高機能C++/GGMLインターフェースで、オーディオツール、プラグイン、モデルトレーニングもサポート。
Inflect v2は、外部ボコーダーを必要とせず、2つのコンパクトなモデル(3.96Mおよび9.36Mパラメータ)で完全な24kHz英語TTSを提供します。アーキテクチャ、評価、CPU展開について詳しく説明します。
KittenTTSは、わずか25MBのモデルで高品質なテキスト読み上げを実現し、完全にCPU上で動作します。使い方、API、エッジAIにとっての重要性について学びましょう。
CrispASRは、ggml上に構築された統合C++音声エンジンで、53のASRモデルと51のTTSモデルをPython依存関係なしでサポートします。Cohere Transcribe、Parakeet、Voxtral、Qwen3などを単一のCLIから実行できます。
FluidAudioは、Apple Neural Engineを使用して、最先端の音声認識、テキスト読み上げ、話者識別、音声アクティビティ検出をすべてデバイス上で実行するためのSwift SDKです。この記事では、その機能、アーキテクチャ、およびアプリへの統合方法について説明します。
SpeechRecognitionを探求する。これは、複数の音声認識エンジンとAPI(オンライン・オフライン両方)をサポートする多用途なPythonライブラリであり、実用的な例とトラブルシューティングのヒントを提供します。
MLXとCoreMLを使用してApple Silicon上でASR、TTS、音声間翻訳、VAD、話者ダイアライゼーションを実現するオープンソースツールキットSpeech Swiftを探る。
Miso TTS 8Bは、80億パラメータを備えた最先端のオープンソース音声合成モデルで、高度に感情的な音声生成と声のクローン作成機能を提供します。