GitHub 趋势 · 第 35 期

22k star 的本地 ElevenLabs 平替:16 个 TTS 引擎装进一个桌面 App

#语音克隆#本地优先#AGPL-3.0

先把判断放在前面:VoiceStudio 不是又一个 TTS 模型,而是一个把 16 个 TTS 引擎、11 个 ASR 引擎塞进同一个桌面 App 的外壳。所以它的价值不在「音质多好」,而在两件事:引擎可以换,以及它自带本地 API(REST/SSE/WebSocket,外加一套 OpenAI 兼容的音频接口)和一个 MCP Server,能把语音能力直接接进你已有的流程。本期所有命令、能力表和许可描述都取自 README 与 LICENSE 原文,未做推测。

你大概已经在忍的那套流程

想用 ElevenLabs 那种声音:按月付费,音频先上传到别人的服务器。想改成本地跑:开源模型一抓一大把,但每个模型一套环境、一套脚本、一堆依赖,装一个试一个,试到第三个就想放弃。等你终于把克隆跑通了,真正的活儿才刚开始 —— 剪几秒参考音频、切语言、给视频配音、出字幕、导成有声书,这些零碎环节没人替你串起来。

所以真正缺的不是「又一个更好的语音模型」,而是一个统一的外壳:把模型当成可插拔零件,把上游那一串流程收进同一个界面和同一套接口。这一期挑的就是这个壳。

项目是什么

仓库名 debpalash/VoiceStudio(https://github.com/debpalash/VoiceStudio),官网 voicestudio.sh。自述原文:「the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages」。README 顶部标着一行小字 Previously OmniVoice-Studio —— 它改过名,所以你现在还会在别处看到旧名字(连官方 Docker 镜像名都还叫 palashdeb/omnivoice-studio:stable)。

数据实测:22,124 star / 2,720 fork,GitHub 月度趋势新增 12,418;仓库 2026-04-09 创建,最近一次推送 2026-09-10,11 个 open issue,未归档。许可为 AGPL-3.0(实测自仓库根目录 LICENSE 文件正文,第一行即「GNU AFFERO GENERAL PUBLIC LICENSE / Version 3, 19 November 2007」),这一点和本系列前几期常见的 MIT / Apache 项目性质不同,下面单独说。技术栈:桌面端 Tauri,后端 Python,源码构建用 Bun,默认一切都在本机跑。

状态必须提前讲清:README 自己标的是 Active beta,并建议稳定工作用 latest release,因为 main 分支在两次发布之间会变。

一张表看清它的边界

下面这张是 README「At a glance」的完整内容,没有删减。建议先扫一遍「平台」和「算力」两行 —— 能不能跑起来,答案就在这两行里。

维度VoiceStudio
工作流语音克隆与设计、视频配音、听写、故事、有声书、批量生成
语言646 种 TTS 语言;实际覆盖与质量取决于所选引擎
引擎16 个 TTS · 11 个 ASR;在 Model Catalogue 里切换,或按 Ctrl / Cmd + E
平台macOS 13.3+(Apple Silicon)· Windows 10/11 x64 · Linux x86_64(glibc 2.39+)
算力CUDA · Apple Silicon MPS/MLX · Linux ROCm · CPU · 可选远程 worker
接口桌面 App · 本地 REST/SSE/WebSocket API · OpenAI 兼容音频 API · MCP Server
存储音色、项目、设置、输出默认留在本机
许可应用 AGPL-3.0;下载的模型沿用各自上游条款

「本地优先」这句在 README 里是有具体承诺的:默认流程下,录音、转写、音色、项目都严格留在本机磁盘,只有你显式配置了远程 worker 或外部 ASR 端点,数据才会离开设备。遥测默认关闭,且要你同意才开;启用后只上报白名单内的、不含内容的用量元数据,明确排除文本、音频、文件名和项目。

16 个引擎里,有一个你可能很熟

这是本期最值得单独拎出来的一行。VoxCPM2 就在它的 TTS 引擎清单里,标注为 30 种语言、支持克隆与指令控制、Apple Silicon 上走 MPS、许可 Apache-2.0。如果你之前已经在自己机器上跑过 VoxCPM2,那这个项目的意义就变了 —— 它相当于给你的模型补上了一个带界面的外壳,外加一套统一接口。

TTS 引擎语言克隆macOS ARM许可
VoiceStudio(默认,基于 k2-fsa/OmniVoice)600+MPS应用 AGPL-3.0 · 代码 Apache-2.0 / 权重 CC-BY-NC
VoxCPM230MPSApache-2.0
CosyVoice 39 + 18 种方言CPUApache-2.0
GPT-SoVITS5不支持MIT
IndexTTS 2.5中/英/日/西/阿CPUBilibili 模型许可(见下文)
PocketTTS英/法/德/葡/意/西CPUCC-BY-4.0,需门控申请
MOSS-TTS-v1.531CPUApache-2.0
KittenTTS英语CPUMIT
MLX-Audio取决于模型视模型MLX视模型

ASR 侧同样是一整排可选件:默认 WhisperX(做配音、字幕、词级时间戳),另外还有 Faster-Whisper(含崩溃隔离版)、MLX Whisper、PyTorch Whisper、Parakeet TDT 与 MLX 版、Moonshine(低功耗 ONNX)、FunASR(含 VAD 与说话人分离)、sherpa-onnx 实时听写,以及一个能指向本地 gigastt / Qwen3-ASR 或远程端点的 OpenAI 兼容 ASR。README 还专门提了一句容错:WhisperX 和 Faster-Whisper 在拿不到高效 float16 时会自动回退到 int8。

一个容易被忽略的设计细节:不支持克隆的引擎,在配音或「锁定音色」的批量任务里无法保留参考说话人 —— VoiceStudio 的做法是直接拒绝这些任务,而不是静默换引擎。对音频生产来说,这个选择比「帮你跑完但声音变了」要靠谱得多。

上手:Docker 一行,或源码两行

最省事的是下预编译包:macOS 13.3+ 用 Apple Silicon 的 DMG,Windows 10/11 用 x64 MSI,Linux 用 AppImage(要 glibc 2.39+)。想先容器里试一下,README 给的是这一条(原文照抄):

docker run -d -p 127.0.0.1:3900:3900 -v omnivoice-data:/app/omnivoice_data --name voicestudio palashdeb/omnivoice-studio:stable

从源码跑(README 原文),前提是 Bun / Node 20+ 与 Python 3.11+,桌面启动器首次运行会通过 uv 自动配好 Python 依赖:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

想要浏览器界面就把最后一行换成 bun run dev。装完第一次跑不通别急着怀疑硬件,README 给了一条自检命令(原文),失败原因它会自己报出来:

uv run python backend/main.py --diagnose --deep

不想装任何东西也能先摸一下:README 提供了一个 Colab notebook 可以在云端跑。第一次做克隆,README 的建议是3 秒的干净样本就能用,5 到 15 秒通常效果更好;并且解释了为什么参考音频不是越长越好 —— 克隆是 zero-shot,这段音频是「提示」而不是训练数据,所以要求单一说话人、靠近麦克风、无音乐噪声混响,语气语速最好贴近你想要的输出。

硬件这块有一个正好卡在线上值得说的点。README 按硬件给了推荐栈:Apple Silicon(M1–M4)首选 MLX-Audio 与 OmniVoice(MPS),ASR 配 MLX Whisper 或 Parakeet MLX,理由是统一内存 + macOS 上延迟最低。而官方要求是内存 8GB 起、推荐 16GB 以上,用 GPU 时显存 4GB 起、推荐 8GB 以上,大型可选引擎要 12 到 16GB 或更多。换句话说,16GB 统一内存的机器刚好落在「推荐线」的起点上 —— 能舒服跑默认流程,但别指望同时挂几个大引擎。

我的判断

适合谁:想把克隆、配音、听写、有声书都放在自己机器上的人;已经有一个语音模型(比如 VoxCPM2)但缺 GUI 和统一接口的人;需要本地语音后端接进自有流程的开发者(本地 API + OpenAI 兼容音频接口 + MCP Server 三条路都留着);Apple Silicon 用户,因为 README 是按 M1–M4 给推荐栈的。
不适合谁:Intel Mac 用户 —— README 明确写了 Intel Mac 跑不了本地后端(当前 PyTorch wheel 不可用),只能连远程后端;Windows on ARM 和想让 AMD 显卡在 Windows 上加速的人(ROCm 只在 Linux 且需手动开启,Windows 上的 AMD/Ryzen AI 走 CPU);以及内存只有 8GB 却想上大引擎的人。

数据与核实:debpalash/VoiceStudio(https://github.com/debpalash/VoiceStudio)· 22,124 star / 2,720 fork / 90 watcher,GitHub 月度趋势新增 12,418 · 创建 2026-04-09 · 最近推送 2026-09-10 · 未归档 · 许可 AGPL-3.0(实测自仓库根目录 LICENSE 文件正文,GNU Affero GPL Version 3)· 能力表、引擎表、平台与硬件要求、安装与自检命令、FAQ 原文均取自 README.md · 引擎许可标注(OmniVoice 权重 CC-BY-NC、IndexTTS 2.5 的 Bilibili 许可门槛、PocketTTS 门控 CC-BY-4.0、tokenizer 条款)取自 README 脚注原文 · 数据来源:GitHub Trending 官方页面 · 抓取时间:2026-09-11 08:55

如果你也在本机折腾过语音克隆,欢迎说说你现在固定用哪个引擎、以及踩过最难受的一个环境的坑 —— 尤其是 Apple Silicon 上的 MPS 与 MLX 两条路,你最后选了哪条?评论区聊聊,我按你们点的来。

下期预告:回到 agent 的基础设施 —— volcengine/OpenViking(36,513 star,本月 +8,469),火山引擎开源的「自演化 Context 数据库」,把 agent 记忆、知识检索和 skills 放进同一套存储(这个项目上上期就预告过,被更热的选题挤了两轮,该还上了)。

#语音克隆#本地优先#AGPL-3.0