📌 项目地址:debpalash/VoiceStudio | ⭐ 13,525 | 🔧 Python | 📜 AGPL-3.0
先交代一个背景:我平时做配音和长文本转语音,用过 ElevenLabs 也用过几个开源 TTS 仓库。前者按字符收费、音频必须过别人的服务器;后者大多是一个模型配一个脚本,拼成完整工作流要自己写不少胶水代码。VoiceStudio 属于第三类——把十几个引擎装进一个桌面应用,核心流程全部本地跑,不要账号、API key、订阅,也没有用量计量。
数字先摆出来,再泼冷水
README 上的参数:16 个 TTS 引擎、11 个 ASR 引擎、646 种语言的目录、macOS / Windows / Linux 三平台。
这里有个容易踩的坑。646 是“目录”数字,README 自己写明了:实际覆盖度和质量取决于所选引擎。别把它理解成“646 种语言都有好效果”。
工作流方面,它覆盖这几块:语音克隆与声音设计、视频配音、听写转写、故事和有声书等长文本生成、批量生成。引擎在 Model Catalogue 里切换,快捷键 Ctrl/Cmd+E。
上手比想象中简单
从 latest release 下载安装包:
| 平台 | 包 | 备注 |
|---|---|---|
| macOS 13.3+ | DMG | 仅 Apple Silicon |
| Windows 10/11 | MSI | x64 |
| Linux | AppImage | x86_64,glibc 2.39+ |
| Docker | — | CUDA / ROCm / CPU 均可,含 worker-only GPU 配置 |
首次启动会自动创建托管 Python 环境并下载默认模型,之后复用,不用手动配环境。
克隆第一个声音的三步(来自 README):
- 打开 Voice Cloning
- 加一段干净的语音样本——3 秒就能跑,README 建议 5–15 秒,提示效果更好
- 输入文本、选语言、点 Generate
从源码跑也不复杂:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
bun run dev 启动浏览器版 UI。
安装出问题时,跑 Settings → About → Run self-check。
两个 macOS 特有的坑:首次启动要右键 → Open 手动放行一次;Intel Mac 跑不了本地 Python 后端,只能配远程后端。手头是 Intel Mac 的可以直接跳过这个项目了。
它不只是个 GUI
这是我觉得这个项目最值钱的部分。除了桌面应用,它还提供:
- 本地 REST / SSE / WebSocket API
- OpenAI 兼容的音频 API——意味着已有 OpenAI 音频接口的应用可以直接指向它
- MCP Server——可以接进 AI Agent 工作流
也就是说,你可以把它当成一台自托管的语音后端服务器用,桌面应用只是它的一层皮。
算力方面,CUDA、Apple Silicon(MPS/MLX)、Linux ROCm、纯 CPU 都支持,还能配置远程 worker——比如本地机器很弱、GPU 在另一台机器上的场景。声音、项目、设置、输出文件默认全部留在本机。
和商业服务比,差距在哪
我的判断:隐私和成本是它的绝对优势——数据不出机器、没有计量计费。代价有两个。一是你要自己出算力;二是开源引擎的克隆自然度和 ElevenLabs 的商业模型有差距,差多少取决于你选哪个引擎,建议实际对比后再下结论。
用之前必须知道的四件事
- 许可证是 AGPL-3.0,部分可选引擎保留各自的模型许可证。想集成进商业产品,AGPL 的传染性要认真评估,这一条可能直接决定你能不能用
- 项目处于活跃 beta,README 建议稳定用途走 release 版本,
main分支放的是最新修复,遇问题通过 GitHub Issues 反馈 - Linux 要求 glibc 2.39+,老发行版装不上
- 引擎的语言覆盖差异很大,选定引擎前先确认目标语言的支持情况
我的结论
如果你经常做语音克隆、视频配音或长文本转语音,介意数据出机器,手头有张显卡或一台 Apple Silicon Mac,装一个试试的成本很低——首次启动自动配环境,三步出第一个声音。反过来,如果你追求极致的克隆效果、完全不想碰配置,商业服务仍然更省事。