2026年8月14日
HOT-Step CPPで、ステレオ48kHzの音楽をローカルに生成。ACE-Step用の高機能C++/GGMLインターフェースで、オーディオツール、プラグイン、モデルトレーニングもサポート。
Inflect v2は、外部ボコーダーを必要とせず、2つのコンパクトなモデル(3.96Mおよび9.36Mパラメータ)で完全な24kHz英語TTSを提供します。アーキテクチャ、評価、CPU展開について詳しく説明します。
KittenTTSは、わずか25MBのモデルで高品質なテキスト読み上げを実現し、完全にCPU上で動作します。使い方、API、エッジAIにとっての重要性について学びましょう。
CrispASRは、ggml上に構築された統合C++音声エンジンで、53のASRモデルと51のTTSモデルをPython依存関係なしでサポートします。Cohere Transcribe、Parakeet、Voxtral、Qwen3などを単一のCLIから実行できます。
FluidAudioは、Apple Neural Engineを使用して、最先端の音声認識、テキスト読み上げ、話者識別、音声アクティビティ検出をすべてデバイス上で実行するためのSwift SDKです。この記事では、その機能、アーキテクチャ、およびアプリへの統合方法について説明します。
SpeechRecognitionを探求する。これは、複数の音声認識エンジンとAPI(オンライン・オフライン両方)をサポートする多用途なPythonライブラリであり、実用的な例とトラブルシューティングのヒントを提供します。
MLXとCoreMLを使用してApple Silicon上でASR、TTS、音声間翻訳、VAD、話者ダイアライゼーションを実現するオープンソースツールキットSpeech Swiftを探る。
Miso TTS 8Bは、80億パラメータを備えた最先端のオープンソース音声合成モデルで、高度に感情的な音声生成と声のクローン作成機能を提供します。
Voice-Proは、最先端の音声クローン、文字起こし、翻訳ツールを1つのワークフローに統合した、強力なオープンソースのGradioベースWebUIです。
タイピングをやめて、話そう。OpenLessは、あなたの声をAIで構造化・洗練されたテキストに変換し、カーソル位置に直接出力する、プライバシー重視のクロスプラットフォームツールです。
Supertonicは、高品質な多言語音声合成をデバイス上で直接実現する、強力なオープンソースの音声合成システムです。ONNX Runtimeを活用することで、SupertonicはクラウドAPIの必要性を排除し、完全なプライバシーとほぼ瞬時のパフォーマンスを保証します。Python、C++、Rust、またはWeb技術を使用する開発者にとって、この軽量エンジンは31言語のサポートと、複雑なテキストに対する優れた読み上げ精度を提供します。この99Mパラメータのモデルが、いかにして速度と効率の面で大規模な代替モデルを凌駕しているかを確認してください。エッジコンピューティング、モバイルアプリ、ブラウザベースのプロジェクトに最適な選択肢です。ローカルでプライベート、かつ超高速な音声生成の未来を今すぐ体験してください。
VoxCPM2を発見してください。画期的な2Bパラメータのトークナイザー不要TTSモデルで、30言語対応、スタジオ品質48kHzオーディオ。テキスト記述から声を生成、完璧な精度で任意のスピーカーをクローニング、リアルタイム性能(RTX 4090でRTF 0.13)を達成。Apache 2.0の完全オープンソースでPython API、CLI、Webデモ、LoRAファインチューニング、本番展開準備完了。主要TTSベンチマークで商用モデルを上回ります。