GitHub 趋势 · 第 35 期
22k star 的本地 ElevenLabs 平替:16 个 TTS 引擎装进一个桌面 App
#语音克隆#本地优先#AGPL-3.0
先把判断放在前面:VoiceStudio 不是又一个 TTS 模型,而是一个把 16 个 TTS 引擎、11 个 ASR 引擎塞进同一个桌面 App 的外壳。所以它的价值不在「音质多好」,而在两件事:引擎可以换,以及它自带本地 API(REST/SSE/WebSocket,外加一套 OpenAI 兼容的音频接口)和一个 MCP Server,能把语音能力直接接进你已有的流程。本期所有命令、能力表和许可描述都取自 README 与 LICENSE 原文,未做推测。
你大概已经在忍的那套流程
想用 ElevenLabs 那种声音:按月付费,音频先上传到别人的服务器。想改成本地跑:开源模型一抓一大把,但每个模型一套环境、一套脚本、一堆依赖,装一个试一个,试到第三个就想放弃。等你终于把克隆跑通了,真正的活儿才刚开始 —— 剪几秒参考音频、切语言、给视频配音、出字幕、导成有声书,这些零碎环节没人替你串起来。
所以真正缺的不是「又一个更好的语音模型」,而是一个统一的外壳:把模型当成可插拔零件,把上游那一串流程收进同一个界面和同一套接口。这一期挑的就是这个壳。
项目是什么
仓库名 debpalash/VoiceStudio(https://github.com/debpalash/VoiceStudio),官网 voicestudio.sh。自述原文:「the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages」。README 顶部标着一行小字 Previously OmniVoice-Studio —— 它改过名,所以你现在还会在别处看到旧名字(连官方 Docker 镜像名都还叫 palashdeb/omnivoice-studio:stable)。
数据实测:22,124 star / 2,720 fork,GitHub 月度趋势新增 12,418;仓库 2026-04-09 创建,最近一次推送 2026-09-10,11 个 open issue,未归档。许可为 AGPL-3.0(实测自仓库根目录 LICENSE 文件正文,第一行即「GNU AFFERO GENERAL PUBLIC LICENSE / Version 3, 19 November 2007」),这一点和本系列前几期常见的 MIT / Apache 项目性质不同,下面单独说。技术栈:桌面端 Tauri,后端 Python,源码构建用 Bun,默认一切都在本机跑。
状态必须提前讲清:README 自己标的是 Active beta,并建议稳定工作用 latest release,因为 main 分支在两次发布之间会变。
一张表看清它的边界
下面这张是 README「At a glance」的完整内容,没有删减。建议先扫一遍「平台」和「算力」两行 —— 能不能跑起来,答案就在这两行里。
| 维度 | VoiceStudio |
|---|---|
| 工作流 | 语音克隆与设计、视频配音、听写、故事、有声书、批量生成 |
| 语言 | 646 种 TTS 语言;实际覆盖与质量取决于所选引擎 |
| 引擎 | 16 个 TTS · 11 个 ASR;在 Model Catalogue 里切换,或按 Ctrl / Cmd + E |
| 平台 | macOS 13.3+(Apple Silicon)· Windows 10/11 x64 · Linux x86_64(glibc 2.39+) |
| 算力 | CUDA · Apple Silicon MPS/MLX · Linux ROCm · CPU · 可选远程 worker |
| 接口 | 桌面 App · 本地 REST/SSE/WebSocket API · OpenAI 兼容音频 API · MCP Server |
| 存储 | 音色、项目、设置、输出默认留在本机 |
| 许可 | 应用 AGPL-3.0;下载的模型沿用各自上游条款 |
「本地优先」这句在 README 里是有具体承诺的:默认流程下,录音、转写、音色、项目都严格留在本机磁盘,只有你显式配置了远程 worker 或外部 ASR 端点,数据才会离开设备。遥测默认关闭,且要你同意才开;启用后只上报白名单内的、不含内容的用量元数据,明确排除文本、音频、文件名和项目。
16 个引擎里,有一个你可能很熟
这是本期最值得单独拎出来的一行。VoxCPM2 就在它的 TTS 引擎清单里,标注为 30 种语言、支持克隆与指令控制、Apple Silicon 上走 MPS、许可 Apache-2.0。如果你之前已经在自己机器上跑过 VoxCPM2,那这个项目的意义就变了 —— 它相当于给你的模型补上了一个带界面的外壳,外加一套统一接口。
| TTS 引擎 | 语言 | 克隆 | macOS ARM | 许可 |
|---|---|---|---|---|
| VoiceStudio(默认,基于 k2-fsa/OmniVoice) | 600+ | 是 | MPS | 应用 AGPL-3.0 · 代码 Apache-2.0 / 权重 CC-BY-NC |
| VoxCPM2 | 30 | 是 | MPS | Apache-2.0 |
| CosyVoice 3 | 9 + 18 种方言 | 是 | CPU | Apache-2.0 |
| GPT-SoVITS | 5 | 是 | 不支持 | MIT |
| IndexTTS 2.5 | 中/英/日/西/阿 | 是 | CPU | Bilibili 模型许可(见下文) |
| PocketTTS | 英/法/德/葡/意/西 | 是 | CPU | CC-BY-4.0,需门控申请 |
| MOSS-TTS-v1.5 | 31 | 是 | CPU | Apache-2.0 |
| KittenTTS | 英语 | 否 | CPU | MIT |
| MLX-Audio | 取决于模型 | 视模型 | MLX | 视模型 |
ASR 侧同样是一整排可选件:默认 WhisperX(做配音、字幕、词级时间戳),另外还有 Faster-Whisper(含崩溃隔离版)、MLX Whisper、PyTorch Whisper、Parakeet TDT 与 MLX 版、Moonshine(低功耗 ONNX)、FunASR(含 VAD 与说话人分离)、sherpa-onnx 实时听写,以及一个能指向本地 gigastt / Qwen3-ASR 或远程端点的 OpenAI 兼容 ASR。README 还专门提了一句容错:WhisperX 和 Faster-Whisper 在拿不到高效 float16 时会自动回退到 int8。
一个容易被忽略的设计细节:不支持克隆的引擎,在配音或「锁定音色」的批量任务里无法保留参考说话人 —— VoiceStudio 的做法是直接拒绝这些任务,而不是静默换引擎。对音频生产来说,这个选择比「帮你跑完但声音变了」要靠谱得多。
上手:Docker 一行,或源码两行
最省事的是下预编译包:macOS 13.3+ 用 Apple Silicon 的 DMG,Windows 10/11 用 x64 MSI,Linux 用 AppImage(要 glibc 2.39+)。想先容器里试一下,README 给的是这一条(原文照抄):
docker run -d -p 127.0.0.1:3900:3900 -v omnivoice-data:/app/omnivoice_data --name voicestudio palashdeb/omnivoice-studio:stable
从源码跑(README 原文),前提是 Bun / Node 20+ 与 Python 3.11+,桌面启动器首次运行会通过 uv 自动配好 Python 依赖:
git clone https://github.com/debpalash/VoiceStudio.git cd VoiceStudio bun install bun run desktop
想要浏览器界面就把最后一行换成 bun run dev。装完第一次跑不通别急着怀疑硬件,README 给了一条自检命令(原文),失败原因它会自己报出来:
uv run python backend/main.py --diagnose --deep
不想装任何东西也能先摸一下:README 提供了一个 Colab notebook 可以在云端跑。第一次做克隆,README 的建议是3 秒的干净样本就能用,5 到 15 秒通常效果更好;并且解释了为什么参考音频不是越长越好 —— 克隆是 zero-shot,这段音频是「提示」而不是训练数据,所以要求单一说话人、靠近麦克风、无音乐噪声混响,语气语速最好贴近你想要的输出。
硬件这块有一个正好卡在线上值得说的点。README 按硬件给了推荐栈:Apple Silicon(M1–M4)首选 MLX-Audio 与 OmniVoice(MPS),ASR 配 MLX Whisper 或 Parakeet MLX,理由是统一内存 + macOS 上延迟最低。而官方要求是内存 8GB 起、推荐 16GB 以上,用 GPU 时显存 4GB 起、推荐 8GB 以上,大型可选引擎要 12 到 16GB 或更多。换句话说,16GB 统一内存的机器刚好落在「推荐线」的起点上 —— 能舒服跑默认流程,但别指望同时挂几个大引擎。
我的判断
适合谁:想把克隆、配音、听写、有声书都放在自己机器上的人;已经有一个语音模型(比如 VoxCPM2)但缺 GUI 和统一接口的人;需要本地语音后端接进自有流程的开发者(本地 API + OpenAI 兼容音频接口 + MCP Server 三条路都留着);Apple Silicon 用户,因为 README 是按 M1–M4 给推荐栈的。
不适合谁:Intel Mac 用户 —— README 明确写了 Intel Mac 跑不了本地后端(当前 PyTorch wheel 不可用),只能连远程后端;Windows on ARM 和想让 AMD 显卡在 Windows 上加速的人(ROCm 只在 Linux 且需手动开启,Windows 上的 AMD/Ryzen AI 走 CPU);以及内存只有 8GB 却想上大引擎的人。
- ▪AGPL-3.0 是强 copyleft,比 MIT 重得多。自己用、内部用没问题,也可以改;但 README 写得很清楚:如果你改了它、并以网络服务的形式对外提供这个改过的版本,AGPL 要求你把对应源码也按同一许可提供。想做专有嵌入,官方提供 VoiceStudio 自有代码的商业许可 —— 注意它不给第三方模型重新授权。打算做成对外产品的话,这一条要在动工前算进成本。
- ▪「App 免费」不等于「生成音频可商用」。这是本篇最需要记住的一条。README 的 FAQ 原文:应用许可不限制你出售生成的音频,但它不授予你模型侧的权利。默认的 OmniVoice 权重标注为 CC-BY-NC(非商用),其快照里的音频 tokenizer 还另带 Boson Higgs Audio 2 与 Meta Llama 社区条款。IndexTTS 2.5 要求月活超过 1 亿或年营收超过 10 亿人民币时另取 Bilibili 书面许可。PocketTTS 首次使用前会弹门控授权与 CC-BY-4.0 条款。要商用就把引擎逐个换到许可干净的(比如 VoxCPM2、CosyVoice 3、MOSS 系列的 Apache-2.0),并自己复核条款。
- ▪它还是 Active beta。README 原文标注为活跃测试版,并建议稳定工作用 latest release,因为 main 分支在两次发布之间会变动。用它做流水线的话,固定版本号,别跟着 main 走。
- ▪两个 macOS 细节会让人以为是装坏了。首次启动需要一次右键再点「打开」放行;Intel Mac 装完跑不起来本地后端不是配置问题,是上游 PyTorch wheel 缺失。
- ▪Docker 镜像只有 linux/amd64。Apple Silicon 上想要 GPU 加速就用原生 macOS App,别用容器 —— README 原文也这么建议。ARM64 主机拉镜像前先看架构要求。
- ▪克隆本身有责任边界,项目自己也认这件事。README 写明只应克隆或合成获得说话人明确许可的音色,并默认集成 AudioSeal 不可感知水印用于标识合成语音。远程访问也不是裸奔的:回环地址以外需要 share PIN 或 API key,非本机端点强制 HTTPS 且不跟随重定向。要用在对外场景,这几条别跳过。
- ▪卸载做得很规矩,顺手提一句。macOS/Linux 跑 scripts/uninstall.sh,Windows 跑 scripts\uninstall.ps1,两者都会先给一次 dry run 再删,README 里还有一份列出所有路径的卸载指南。装过一堆环境没清干净过的人会懂这个细节的价值。
数据与核实:debpalash/VoiceStudio(https://github.com/debpalash/VoiceStudio)· 22,124 star / 2,720 fork / 90 watcher,GitHub 月度趋势新增 12,418 · 创建 2026-04-09 · 最近推送 2026-09-10 · 未归档 · 许可 AGPL-3.0(实测自仓库根目录 LICENSE 文件正文,GNU Affero GPL Version 3)· 能力表、引擎表、平台与硬件要求、安装与自检命令、FAQ 原文均取自 README.md · 引擎许可标注(OmniVoice 权重 CC-BY-NC、IndexTTS 2.5 的 Bilibili 许可门槛、PocketTTS 门控 CC-BY-4.0、tokenizer 条款)取自 README 脚注原文 · 数据来源:GitHub Trending 官方页面 · 抓取时间:2026-09-11 08:55
如果你也在本机折腾过语音克隆,欢迎说说你现在固定用哪个引擎、以及踩过最难受的一个环境的坑 —— 尤其是 Apple Silicon 上的 MPS 与 MLX 两条路,你最后选了哪条?评论区聊聊,我按你们点的来。
下期预告:回到 agent 的基础设施 —— volcengine/OpenViking(36,513 star,本月 +8,469),火山引擎开源的「自演化 Context 数据库」,把 agent 记忆、知识检索和 skills 放进同一套存储(这个项目上上期就预告过,被更热的选题挤了两轮,该还上了)。
#语音克隆#本地优先#AGPL-3.0