📌 项目地址abus-aikorea/voice-pro | ⭐ 11,651 颗星 | 🔧 Python | 📜 未标注

不是又一款TTS玩具,而是一条完整的语音生产线

Voice-Pro 是一个基于 Gradio 的 Web 应用,作者将其定位为 ElevenLabs 的开源替代方案。它解决的问题不是”合成一段语音”,而是把语音相关的多步工作流——YouTube 下载、人声分离、语音识别、翻译、配音——全部装进一个本地网页界面里,对创作者和开发者而言,意味着不必在五六个工具之间来回切换。

项目本体完全开源免费,作者因其他开发工作暂停了更新,但代码库已开放给任何人自由分发和修改。这一点对使用者来说反而是个机会:核心功能已稳定,不会再出现”某天突然闭源收费”的情况。

功能拆解:每个模块都是能打的工具

整个工具由五个彼此独立又能串联的模块构成:

  • 语音识别(ASR):内置三套引擎——openai-whisper、faster-whisper、whisper-timestamped,覆盖从高精度到批量处理的不同需求。faster-whisper 1.2.1 支持 large-v3-turbo 和 distil-large-v3.5 模型。
  • 零样本声音克隆:F5-TTS、E2-TTS、CosyVoice,外加一个可选的 Fun-CosyVoice3-0.5B,支持中、英、韩等 9 种语言。零样本意味着不需要针对特定人声做训练,只需一段参考音频就能克隆音色。
  • 多语言 TTS:Edge-TTS 免费且开箱即用;kokoro 体积小、速度快;如果你有自己的 Azure 密钥,也可以接入 Azure TTS。
  • 音频处理:yt-dlp 下载 YouTube 视频,Demucs 做人声和伴奏分离——这是为后续配音/翻译场景准备的。
  • 翻译:Deep-Translator 覆盖 100+ 语言,同样可选配 Azure Translator。

注意一个细节:WhisperX 在 4.0 版本中被移除了,原因是它的依赖与 Gradio 6 升级冲突。如果你的旧配置里指向 WhisperX,现在会自动回退到 faster-whisper。这说明作者在版本升级时优先考虑了整体稳定性和现代 GPU 支持,而不是保留所有历史组件。

实际用法:双击启动,浏览器操作

项目没有提供复杂的命令行交互,安装和运行围绕 start.bat 展开。Windows 用户双击该文件即可启动 WebUI,所有操作——上传视频、下载 YouTube 内容、选择模型、生成语音——都在浏览器界面中完成,无需编写代码。


需要说明的是,README 中没有提供更细粒度的安装命令。完整步骤(如 Git 克隆、uv 安装、模型下载位置等)建议直接参考官方文档和仓库内的说明文件。

遇到报错时,官方给出的排障路径很直接:删除 installer_files 文件夹,然后重新运行 start.bat。重新安装只需几分钟,已下载的 AI 模型保存在 model/ 目录中,不会被删掉。WebUI 中的错误会以红色 toast 提示显示,并且会一直存在直到你手动关闭——这是刻意的设计,避免错误信息被误触消失。

对比 ElevenLabs:强在所有权,弱在运维

官方 README 自称是”ElevenLabs 的强有力替代方案”,这两个工具可以做一个直观对比:

  • ElevenLabs 是纯云服务,按字符计费,数据需要上传到第三方服务器;Voice-Pro 完全本地运行,一次安装永久免费,音频数据不出本机。
  • ElevenLabs 是单一能力(TTS/克隆)的 API;Voice-Pro 把下载、分离、识别、翻译、合成串成了完整链路。
  • ElevenLabs 有成熟的 API、文档和商业支持;Voice-Pro 的 WEBUI 适合单人/小团队使用,但不适合需要高并发、低延迟的线上业务。
  • ElevenLabs 开箱即用;Voice-Pro 需要本地 GPU 环境(官方说明在 Windows + NVIDIA GPU 上运行良好,Mac 和 Linux 未验证)。

如果你需要的是一个稳定的 API 服务,ElevenLabs 可能仍是最省心的选择。如果你不想付费、需要批量处理、且在意音频数据隐私,Voice-Pro 的本地属性就是最大优势。

运行环境与已知限制

  • 平台支持:官方只验证了 Windows + NVIDIA GPU。Mac 和 Linux 用户需要自行折腾,环境问题可能需要自己解决。
  • 安装依赖:4.0 版本用 uv 替代了 Miniconda/pip,Python 3.12 + Torch 2.8.0(支持 RTX 50 系列显卡),一切依赖锁定在 uv.lock 中,可复现性强。
  • 软件状态:作者因 WeConnect 业务暂停了 Voice-Pro 的更新,代码已开源免费,不会突然变成付费软件,但也不要期待高频新功能。
  • 修复成本:大多数故障的重装时间只需几分钟,且模型文件保留,不算沉重的恢复成本。

这个项目适合谁?一句话:如果你想在本地搭建一套完整的语音识别 + 翻译 + 配音工作流,不想为每次合成付费,且拥有一台 NVIDIA 显卡的 Windows 机器,它可能比任何单一商业服务都更匹配你的需求。

这篇文章对你有帮助吗?

发表回复