📌 项目地址debpalash/VoiceStudio | ⭐ 13,525 | 🔧 Python | 📜 AGPL-3.0

先交代一个背景:我平时做配音和长文本转语音,用过 ElevenLabs 也用过几个开源 TTS 仓库。前者按字符收费、音频必须过别人的服务器;后者大多是一个模型配一个脚本,拼成完整工作流要自己写不少胶水代码。VoiceStudio 属于第三类——把十几个引擎装进一个桌面应用,核心流程全部本地跑,不要账号、API key、订阅,也没有用量计量。

数字先摆出来,再泼冷水

README 上的参数:16 个 TTS 引擎、11 个 ASR 引擎、646 种语言的目录、macOS / Windows / Linux 三平台。

这里有个容易踩的坑。646 是“目录”数字,README 自己写明了:实际覆盖度和质量取决于所选引擎。别把它理解成“646 种语言都有好效果”。

工作流方面,它覆盖这几块:语音克隆与声音设计、视频配音、听写转写、故事和有声书等长文本生成、批量生成。引擎在 Model Catalogue 里切换,快捷键 Ctrl/Cmd+E。

上手比想象中简单

latest release 下载安装包:

平台 备注
macOS 13.3+ DMG 仅 Apple Silicon
Windows 10/11 MSI x64
Linux AppImage x86_64,glibc 2.39+
Docker CUDA / ROCm / CPU 均可,含 worker-only GPU 配置

首次启动会自动创建托管 Python 环境并下载默认模型,之后复用,不用手动配环境。

克隆第一个声音的三步(来自 README):

  1. 打开 Voice Cloning
  2. 加一段干净的语音样本——3 秒就能跑,README 建议 5–15 秒,提示效果更好
  3. 输入文本、选语言、点 Generate

从源码跑也不复杂:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

bun run dev 启动浏览器版 UI。

安装出问题时,跑 Settings → About → Run self-check

两个 macOS 特有的坑:首次启动要右键 → Open 手动放行一次;Intel Mac 跑不了本地 Python 后端,只能配远程后端。手头是 Intel Mac 的可以直接跳过这个项目了。

它不只是个 GUI

这是我觉得这个项目最值钱的部分。除了桌面应用,它还提供:

  • 本地 REST / SSE / WebSocket API
  • OpenAI 兼容的音频 API——意味着已有 OpenAI 音频接口的应用可以直接指向它
  • MCP Server——可以接进 AI Agent 工作流

也就是说,你可以把它当成一台自托管的语音后端服务器用,桌面应用只是它的一层皮。

算力方面,CUDA、Apple Silicon(MPS/MLX)、Linux ROCm、纯 CPU 都支持,还能配置远程 worker——比如本地机器很弱、GPU 在另一台机器上的场景。声音、项目、设置、输出文件默认全部留在本机。

和商业服务比,差距在哪

我的判断:隐私和成本是它的绝对优势——数据不出机器、没有计量计费。代价有两个。一是你要自己出算力;二是开源引擎的克隆自然度和 ElevenLabs 的商业模型有差距,差多少取决于你选哪个引擎,建议实际对比后再下结论。

用之前必须知道的四件事

  • 许可证是 AGPL-3.0,部分可选引擎保留各自的模型许可证。想集成进商业产品,AGPL 的传染性要认真评估,这一条可能直接决定你能不能用
  • 项目处于活跃 beta,README 建议稳定用途走 release 版本,main 分支放的是最新修复,遇问题通过 GitHub Issues 反馈
  • Linux 要求 glibc 2.39+,老发行版装不上
  • 引擎的语言覆盖差异很大,选定引擎前先确认目标语言的支持情况

我的结论

如果你经常做语音克隆、视频配音或长文本转语音,介意数据出机器,手头有张显卡或一台 Apple Silicon Mac,装一个试试的成本很低——首次启动自动配环境,三步出第一个声音。反过来,如果你追求极致的克隆效果、完全不想碰配置,商业服务仍然更省事。

这篇文章对你有帮助吗?

发表回复