AIBit-探索开源项目 AIBit-探索开源项目
开源项目网络爬虫与数据AI 智能体与自动化AI 工具与资源
更多
学习与教程AI 研究与基准测试开发与安全网络与基础设施媒体与内容创作硬件与边缘人工智能创业资源
AIBit-探索开源项目 › AI 工具与资源› 语音与音频 AI

2026年9月19日

VoiceStudio:完全本地化的开源语音 AI 工作台

探索 VoiceStudio:一款本地化的 ElevenLabs 替代方案,支持在 646 种语言中进行语音克隆、配音、听写、转录和有声书制作。

  • 2026年9月14日

    YuE2:基于可编辑乐谱与 AI 智能体的开放音乐生成

    YuE2 将歌词和风格提示转换为可编辑的音乐乐谱、前沿品质的歌曲、零样本翻唱作品,并支持由智能体驱动的修改。

  • 2026年9月14日

    VoiceStudio:完全本地化的开源 ElevenLabs 替代方案

    VoiceStudio 将语音克隆、配音、听写、转录和有声书功能带到你的硬件上,支持 16 个 TTS 引擎和 11 个 ASR 引擎。

  • 2026年8月30日

    StemDeck:基于 Demucs 和 Tauri 的免费本地 6 音轨 AI 音频分离工具

    StemDeck 是一款开源、本地优先的分轨提取工作台,无需云端订阅或文件上传,即可分离人声、鼓点、贝斯、吉他和钢琴。

  • 2026年8月14日

    HOT-Step CPP:使用 C++ 和 GGML 进行本地 AI 音乐生成

    使用 HOT-Step CPP 在本地生成立体声 48 kHz 音乐,这是一个功能丰富的 C++/GGML 接口,用于 ACE-Step、音频工具、插件和模型训练。

  • 2026年8月2日

    Inflect v2:3.96M 和 9.36M 参数的本地文本到波形 TTS

    Inflect v2 以两个紧凑模型(3.96M 和 9.36M 参数)提供完整的 24 kHz 英语 TTS,无需外部声码器。探索架构、评估和 CPU 部署。

  • 2026年8月2日

    KittenTTS:不到25MB的最先进TTS,可在CPU上运行

    KittenTTS以最小25MB的模型提供高质量文本转语音,完全在CPU上运行。了解如何使用它、其API以及它对边缘AI的重要性。

  • 2026年7月30日

    CrispASR:一个C++二进制文件,支持53个ASR和51个TTS模型

    CrispASR是一个基于ggml的统一C++语音引擎,支持53个ASR和51个TTS模型,零Python依赖。通过单个CLI即可运行Cohere Transcribe、Parakeet、Voxtral、Qwen3等模型。

  • 2026年7月22日

    FluidAudio:在Apple设备上本地运行SOTA音频AI模型,借助CoreML

    FluidAudio是一个Swift SDK,用于完全在设备上运行最先进的语音转文字、文字转语音、说话人分离和语音活动检测,利用Apple神经网络引擎。本文探讨了其功能、架构以及如何将其集成到你的应用中。

  • 2026年7月22日

    SpeechRecognition:一个全面的Python语音转文字库

    探索SpeechRecognition,一个支持多种在线和离线语音识别引擎及API的多功能Python库,包含实用示例和故障排除技巧。

  • 2026年7月11日

    Speech Swift:专为 Apple Silicon 打造的本地 AI 语音工具包

    探索 Speech Swift,一个开源工具包,利用 MLX 和 CoreML 在 Apple Silicon 上实现 ASR、TTS、语音到语音、VAD 和说话人分离。

  • 2026年6月6日

    Miso TTS 8B:高质量开源文本转语音模型

    Miso TTS 8B 是一款拥有80亿参数、最先进的开源文本转语音模型,具备高度情感化的语音生成和声音克隆能力。

上一页 1 / 4 下一页

为人工智能开发者精心策划的 AI 工具、开源项目、教程及资源。

服务条款 隐私政策 © 2026 AIBit-探索开源项目