2026年9月19日
探索 VoiceStudio:一款本地化的 ElevenLabs 替代方案,支持在 646 种语言中进行语音克隆、配音、听写、转录和有声书制作。
YuE2 将歌词和风格提示转换为可编辑的音乐乐谱、前沿品质的歌曲、零样本翻唱作品,并支持由智能体驱动的修改。
VoiceStudio 将语音克隆、配音、听写、转录和有声书功能带到你的硬件上,支持 16 个 TTS 引擎和 11 个 ASR 引擎。
StemDeck 是一款开源、本地优先的分轨提取工作台,无需云端订阅或文件上传,即可分离人声、鼓点、贝斯、吉他和钢琴。
使用 HOT-Step CPP 在本地生成立体声 48 kHz 音乐,这是一个功能丰富的 C++/GGML 接口,用于 ACE-Step、音频工具、插件和模型训练。
Inflect v2 以两个紧凑模型(3.96M 和 9.36M 参数)提供完整的 24 kHz 英语 TTS,无需外部声码器。探索架构、评估和 CPU 部署。
KittenTTS以最小25MB的模型提供高质量文本转语音,完全在CPU上运行。了解如何使用它、其API以及它对边缘AI的重要性。
CrispASR是一个基于ggml的统一C++语音引擎,支持53个ASR和51个TTS模型,零Python依赖。通过单个CLI即可运行Cohere Transcribe、Parakeet、Voxtral、Qwen3等模型。
FluidAudio是一个Swift SDK,用于完全在设备上运行最先进的语音转文字、文字转语音、说话人分离和语音活动检测,利用Apple神经网络引擎。本文探讨了其功能、架构以及如何将其集成到你的应用中。
探索SpeechRecognition,一个支持多种在线和离线语音识别引擎及API的多功能Python库,包含实用示例和故障排除技巧。
探索 Speech Swift,一个开源工具包,利用 MLX 和 CoreML 在 Apple Silicon 上实现 ASR、TTS、语音到语音、VAD 和说话人分离。
Miso TTS 8B 是一款拥有80亿参数、最先进的开源文本转语音模型,具备高度情感化的语音生成和声音克隆能力。