2026年8月14日
使用 HOT-Step CPP 在本地生成立体声 48 kHz 音乐,这是一个功能丰富的 C++/GGML 接口,用于 ACE-Step、音频工具、插件和模型训练。
Inflect v2 以两个紧凑模型(3.96M 和 9.36M 参数)提供完整的 24 kHz 英语 TTS,无需外部声码器。探索架构、评估和 CPU 部署。
KittenTTS以最小25MB的模型提供高质量文本转语音,完全在CPU上运行。了解如何使用它、其API以及它对边缘AI的重要性。
CrispASR是一个基于ggml的统一C++语音引擎,支持53个ASR和51个TTS模型,零Python依赖。通过单个CLI即可运行Cohere Transcribe、Parakeet、Voxtral、Qwen3等模型。
FluidAudio是一个Swift SDK,用于完全在设备上运行最先进的语音转文字、文字转语音、说话人分离和语音活动检测,利用Apple神经网络引擎。本文探讨了其功能、架构以及如何将其集成到你的应用中。
探索SpeechRecognition,一个支持多种在线和离线语音识别引擎及API的多功能Python库,包含实用示例和故障排除技巧。
探索 Speech Swift,一个开源工具包,利用 MLX 和 CoreML 在 Apple Silicon 上实现 ASR、TTS、语音到语音、VAD 和说话人分离。
Miso TTS 8B 是一款拥有80亿参数、最先进的开源文本转语音模型,具备高度情感化的语音生成和声音克隆能力。
Voice-Pro 是一个强大的、基于 Gradio 的开源 WebUI,它将最先进的语音克隆、转录和翻译工具整合到一个工作流程中。
停止打字,开始说话。OpenLess 是一款跨平台、注重隐私的工具,可将你的语音直接转化为结构化、经 AI 润色的文本,并自动输入到光标所在位置。
探索 Supertonic,这是一款功能强大的开源语音合成系统,可将高质量的多语言语音合成直接带到您的设备上。通过利用 ONNX Runtime,Supertonic 消除了对云 API 的需求,确保了完全的隐私和近乎即时的性能。无论您是使用 Python、C++、Rust 还是 Web 技术的开发者,这款轻量级引擎都提供 31 种语言支持,并对复杂文本具有卓越的阅读准确性。了解这款 99M 参数的模型如何在速度和效率上超越大型替代方案,使其成为边缘计算、移动应用和基于浏览器的项目的完美选择。立即探索本地、私密且闪电般快速的语音生成未来。
发现VoxCPM2,这款开创性的2B参数无分词器TTS模型,支持30种语言,提供录音棚品质的48kHz音频。从文本描述创建语音,完美保真克隆任意说话人,实现实时性能(RTX 4090上RTF 0.13)。完全开源,Apache 2.0许可,提供Python API、CLI、Web Demo、LoRA微调和生产部署就绪。在主要TTS基准测试中超越商业模型。