VoiceStudio:完全本地化的开源 ElevenLabs 替代方案
VoiceStudio 将语音克隆、配音、听写、转录和有声书功能带到你的硬件上,支持 16 个 TTS 引擎和 11 个 ASR 引擎。
VoiceStudio:完全本地化的开源 ElevenLabs 替代方案
云端语音平台使用方便,但也会带来持续性费用、使用限制、账户要求,以及可能不适合处理私人录音的数据传输路径。VoiceStudio 采取了相反的方式:它是一款开源的桌面端和本地服务器应用,支持语音克隆、语音设计、视频配音、听写、转录和长篇音频制作。
该项目支持 16 个文本转语音引擎、11 个语音识别引擎,以及最多涵盖 646 种 TTS 语言的语言目录。它可运行于 macOS、Windows、Linux 和 Docker,并支持 CUDA、Apple Silicon MPS/MLX、Linux ROCm、CPU 推理以及可选的远程工作节点。
因此,它更像是一个本地语音制作平台,而不是单一的语音生成模型。你可以针对不同任务选择引擎,将项目数据保存在本地磁盘,提供兼容 OpenAI 的 API,或通过 MCP 连接 AI 智能体。
VoiceStudio 目前处于活跃测试阶段。稳定工作请使用最新版本;
main分支可能会在版本发布之间发生变化。
为什么本地语音生成很重要
托管语音服务通常会替你管理模型、GPU、扩展和更新。这让安装变得简单,但也意味着音频和文本会由服务提供商处理,并且成本会随使用量增加。VoiceStudio 将这些取舍转移到你自己的设备上:
| 关注点 | VoiceStudio | 典型的托管服务 |
|---|---|---|
| 数据路径 | 默认本地运行;远程功能需主动启用 | 音频和文本由服务提供商处理 |
| 成本 | 软件免费;硬件由你提供 | 订阅费、点数或按量计费的 API 使用费 |
| 离线使用 | 可以,安装模型后即可 | 通常需要互联网连接 |
| 可定制性 | 开源、多引擎、本地路由 | 受限于服务提供商的选项 |
| 性能 | 取决于你的硬件和引擎 | 由服务提供商管理计算资源和扩展 |
| 维护 | 由你管理模型、更新、磁盘和计算资源 | 由服务提供商管理基础设施 |
这使它特别适合私人录音、内部应用、高容量生成、离线工作流,以及需要控制模型选择的开发者。
你可以用 VoiceStudio 构建什么
VoiceStudio 将其功能划分为多个制作工作流。
语音克隆和设计
Voice 工作区包含三种主要模式:
- 从音频创建 — 从一段短参考音频中克隆声音。
- 通过设计创建 — 根据年龄、口音、音高、风格和表达方式等属性创建声音。
- 转换 — 执行语音到语音的转换。
对于零样本克隆,三秒音频即可使用,而 5–15 秒通常能提供更好的提示。参考音频应只包含一位说话者,并尽量减少噪声、音乐或混响。更长的音频并不一定更好,因为该片段充当的是提示,而不是训练数据。
典型的首次生成流程如下:
- 启动 VoiceStudio 并打开 Voice Cloning。
- 添加一段干净的参考录音。
- 输入要合成的文本。
- 选择语言和声音配置。
- 点击 Generate。
只有在获得说话者明确许可的情况下,才应执行语音克隆。
视频配音
配音工作流可以转录视频、翻译对白、保留说话者分配、合成新的语音,并导出完成的视频。它支持文件上传和 URL 导入、字幕、可选的 YouTube 登录、转录文本编辑、术语表、音轨选择以及时间检查。
编辑器在同一工作区中结合了波形和带时间信息的转录文本。点击波形即可定位,或拖动放大的波形进行平移。翻译语言和 ISO 代码控件会保持同步,而转录片段则提供文本、时间、状态和声音控制。
完成的配音可以在导出前标记时间问题,以便检查。对于需要保留参考说话者的工作流,系统会拒绝不支持克隆的引擎,而不会悄悄切换到其他引擎。
有声书和长篇音频
有声书编辑器支持多声音脚本、EPUB 和 PDF 导入、章节渲染以及 .m4b 导出。脚本编辑器占据主工作区,而声音分配和书籍设置保留在单独的选项卡中,因此管理较长项目时,可以避免将制作设置与文本编辑混在一起。
听写和转录
VoiceStudio 包含一个支持全局快捷键、实时转录和可选本地 LLM 清理功能的系统级听写小组件。在语音识别方面,用户可以从 WhisperX、Faster-Whisper、MLX Whisper、Parakeet、Moonshine、FunASR、Sherpa-ONNX 以及已配置的 OpenAI 兼容服务器中进行选择。
WhisperX 是配音、字幕、词级时间信息和说话人日志的默认选择。Apple Silicon 用户可以使用 MLX Whisper 或 Parakeet MLX,而仅使用 CPU 的系统可以使用 Moonshine 或 int8 Faster-Whisper,以降低内存占用。
其他媒体工具
该平台还包括:
- 使用 Demucs 进行人声分离
- 使用 Pyannote 和 WhisperX 进行说话人日志分析
- 用于音频和视频任务的批处理队列
- 监视新添加视频的文件夹
- 通过 AudioSeal 嵌入和检测 AI 水印
- 为已注册的工作节点远程下载模型
- 用于安装、移除和路由引擎的模型目录
安装选项
该项目为 macOS、Windows 和 Linux 提供打包版本,同时也提供 Docker 镜像。
| 平台 | 软件包或要求 |
|---|---|
| macOS | Apple Silicon、macOS 13.3+、DMG |
| Windows | Windows 10/11 x64、MSI;支持当前用户安装 |
| Linux | x86_64,glibc 2.39+、AppImage |
| Docker | 支持 CUDA、ROCm、CPU 和仅工作节点 GPU 配置的 Linux/AMD64 镜像 |
首次启动时,VoiceStudio 会创建一个受管理的 Python 环境并下载默认模型。之后的启动会复用该环境和模型缓存。
对于 Docker,发布的镜像仅支持 linux/amd64:
docker run -d \
-p 127.0.0.1:3900:3900 \
-v omnivoice-data:/app/omnivoice_data \
--name voicestudio \
palashdeb/omnivoice-studio:stable
Apple Silicon 用户通常应使用原生 macOS 应用来获得 GPU 加速。ARM64 主机在拉取容器镜像前,应确认架构要求。
从源代码运行
开发需要 Node 20 或更高版本、Bun,以及 Python 3.11 或更高版本:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
桌面启动器会通过 uv 自动配置 Python 依赖。若要运行浏览器界面:
bun run dev
如果启动失败,请从 Settings → About → Run self-check 运行内置诊断,或执行:
uv run python backend/main.py --diagnose --deep
硬件和引擎选择
VoiceStudio 支持 CPU 运行,但 GPU 可以显著提升生成速度。项目为默认本地工作流列出了以下基本要求:
| 资源 | 最低要求 | 推荐配置 |
|---|---|---|
| 内存 | 8 GB | 16 GB 或更多 |
| 可用磁盘空间 | 10 GB | SSD 上 20 GB 或更多 |
| 显存 | GPU 使用需 4 GB | 8 GB 或更多 |
| Python | 3.11+ | 3.11 或 3.12 |
大型可选引擎可能需要 12–16 GB 或更多显存。ROCm 仅支持 Linux,且需主动启用;Windows AMD/Ryzen AI 系统使用 CPU 推理。显存有限的系统可以将工作卸载到 CPU。
推荐组合包括:
- Apple Silicon M1–M4: 使用 MPS 的 MLX-Audio 或 OmniVoice;ASR 使用 MLX Whisper 或 Parakeet MLX。
- 显存 8 GB 以上的 NVIDIA GPU: OmniVoice 或 CosyVoice 3;使用 WhisperX 进行转录和说话人日志分析。
- 低显存或仅 CPU: PocketTTS、Sherpa-ONNX 或 KittenTTS;ASR 使用 Moonshine 或 int8 Faster-Whisper。
引擎目录包括 OmniVoice、CosyVoice 3、GPT-SoVITS、VoxCPM2、MOSS-TTS、KittenTTS、MLX-Audio、Sherpa-ONNX、IndexTTS、PocketTTS、Supertonic、dots.tts 和 Confucius4-TTS。各引擎的能力差异很大:有些支持克隆和基于指令的合成,另一些则专注于 CPU,或仅支持特定语言。
在生产环境中使用前,务必确认引擎的语言覆盖范围、平台支持、内存要求、克隆能力和模型许可证。
本地 API 和 OpenAI 兼容性
桌面应用通过绑定到 localhost:3900 的 FastAPI 后端进行通信。后端提供 REST、Server-Sent Events、WebSockets、兼容 OpenAI 的音频 API,以及 MCP 服务器。
将 OpenAI 客户端的基础 URL 更改为本地后端:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3900/v1",
api_key="local",
)
with client.audio.speech.with_streaming_response.create(
model="tts-1",
voice="<profile-id>",
input="Made on my own hardware.",
response_format="wav",
) as response:
response.stream_to_file("speech.wav")
cURL 请求同样简单:
curl http://localhost:3900/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1",
"input": "Made on my own hardware.",
"voice": "default",
"response_format": "wav"
}' \
--output speech.wav
重要端点包括:
POST /v1/audio/speech— 生成 MP3、Opus、AAC、FLAC、WAV 或 PCM 音频。POST /v1/audio/transcriptions— 返回 JSON、文本、详细 JSON、SRT 或 VTT。WS /v1/audio/transcriptions/stream— 流式传输部分和最终转录事件。GET /v1/audio/voices— 列出本地声音配置和引擎。GET /.well-known/voicestudio-speech— 发现可用的语音传输方式。
回环调用不需要服务器密钥。远程访问需要共享 PIN 或 API 密钥,LAN、Tailscale 或代理部署应遵循项目的身份验证指南。
MCP 和智能体集成
VoiceStudio 在 http://localhost:3900/mcp 提供 MCP 服务器,使 Claude Desktop、Cursor 和其他 MCP 客户端能够调用合成和转录工具。
{
"mcpServers": {
"voicestudio": {
"url": "http://localhost:3900/mcp"
}
}
}
对于要求 stdio 传输的客户端,代码仓库包含一个本地 shim:
{
"mcpServers": {
"voicestudio": {
"command": "python",
"args": ["-m", "backend.mcp_shim"],
"cwd": "/path/to/VoiceStudio"
}
}
}
MCP 工具包括 generate_speech、clone_voice 和 transcribe,并支持文件流模式和客户端绑定。Claude Code、Codex、Cursor 及兼容智能体的项目技能可以通过以下命令安装:
npx skills add debpalash/VoiceStudio
隐私、安全与许可证
默认的桌面工作流会将录音、转录文本、声音、项目、设置和输出保存在本地设备上。远程工作节点和兼容 OpenAI 的 ASR 端点都需要主动启用。非回环端点需要 HTTPS,并且不会跟随重定向。
在获得同意之前,分析功能处于禁用状态。启用后,它只会发送经过允许列表限制且不包含内容的使用元数据,不会发送文本、音频、文件名或项目数据。
VoiceStudio 采用 AGPL-3.0 许可证。你可以运行、修改并在内部使用它。如果你修改应用并将其作为网络服务提供,AGPL 要求你以相同许可证提供相应源代码。对于将 VoiceStudio 自有代码嵌入专有产品,项目提供商业许可证,但这不会重新授权第三方模型。
模型和分词器的条款是分开的。例如,默认的 OmniVoice 设置包含标注为 CC-BY-NC 的预训练权重,以及带有额外上游条款的音频分词器。应用许可证不会自动授予所有下载模型的商业使用权。
该项目还默认集成 AudioSeal 水印技术,以帮助检测和识别合成语音,同时不改变其可听质量。
适合哪些人使用?
如果你需要以下功能,VoiceStudio 会非常合适:
- 私密或离线语音生成
- 无需按请求付费的高容量合成
- 本地语音克隆和多语言配音
- 桌面工作流加可编程 API
- 在一个应用中使用多个 TTS 和 ASR 引擎
- 通过 MCP 与编码智能体集成
- 控制模型路由、硬件和存储
如果你希望获得零配置的云端扩展能力、本地磁盘或计算资源不足,或者需要一个为所有模型提供统一商业许可证的单一服务商,那么它可能不太适合你。
VoiceStudio 已获得 26.9k 个 GitHub stars、3.3k 个 forks,并拥有 38 个版本和活跃的开发历史,已经超越了简单的语音克隆演示。桌面工具、本地 API、模型路由、配音工作流和智能体集成的结合,使其成为开发者在自有硬件上构建私密语音应用的实用基础。
来源
debpalash/VoiceStudio:VoiceStudio 是开源、完全本地化的 ElevenLabs 替代方案——支持 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声书制作。