判断先给:ElevenLabs 管输出、WisprFlow 管输入,两家都要订阅。Voicebox 把「说」和「听」做成了同一个本地优先的开源工作室——模型、声音样本、录音全不离开你的机器,许可是干净的 MIT,可以商用、可以改。但它最猛的能力(几秒音频复刻任意人声)也正是最大的雷,下面细说。
一、它到底能做什么
一句话:一个跑在你自己电脑上的 AI 语音工作室,克隆声音、生成语音、全局听写、给 AI Agent 配一个你拥有的声音,这四件事在一个 App 里全做了。它把自己定位成 ElevenLabs 和 WisprFlow 两个云产品的本地开源替代。
- 声音克隆与预设:零样本克隆(给一段参考音频就行),或用 Kokoro / Qwen CustomVoice 自带的 50+ 预设音色;
- 7 个 TTS 引擎可逐次切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言;
- 语音转文字(听写):用 OpenAI Whisper,全局热键按住就说、松手即贴进任意输入框;
- 给 Agent 配音:内置 MCP Server,Claude Code / Cursor / Cline 一句 voicebox.speak 就能用你克隆的声音开口;
- 后期效果(音高、混响、延迟、压缩等 8 种,来自 Spotify 的 pedalboard)、故事多轨时间线、声音档案管理。
| 引擎 | 语言 | 特点 |
|---|---|---|
| Qwen3-TTS (0.6B / 1.7B) | 10 | 高质量多语克隆,支持「说得慢一点」「小声说」这类指令 |
| Qwen CustomVoice | 10 | 9 个预设音色,自然语言控制语气,无需参考音频 |
| LuxTTS | 英语 | 轻量约 1GB 显存,CPU 上 150 倍实时 |
| Chatterbox Multilingual | 23 | 语种覆盖最广 |
| Chatterbox Turbo | 英语 | 3.5 亿小模型,支持 [laugh] [sigh] 等情绪标签 |
| HumeAI TADA (1B / 3B) | 10 | 语音-语言模型,700 秒以上连贯音频 |
| Kokoro | 8 | 8200 万极小模型,50 个预设音色,CPU 快 |
二、怎么用(命令均取自 README 原文)
普通用户直接下安装包,开发者用源码跑:
| 平台 | 获取方式 |
|---|---|
| macOS (Apple Silicon) | 下载 DMG(voicebox.sh/download/mac-arm) |
| macOS (Intel) | 下载 DMG(voicebox.sh/download/mac-intel) |
| Windows | 下载 MSI(voicebox.sh/download/windows) |
| Docker | docker compose up |
| Linux | 暂无预编译二进制,需按 voicebox.sh/linux-install 从源码编译 |
把声音接进 Claude Code(MCP,逐字照抄 README):
claude mcp add voicebox \ --transport http \ --url http://127.0.0.1:17493/mcp \ --header "X-Voicebox-Client-Id: claude-code"
REST API 也直接可用(部分示例):
curl -X POST http://127.0.0.1:17493/generate \
-H "Content-Type: application/json" \
-d '{"text": "Hello world", "profile_id": "abc123", "language": "en"}'
curl -X POST http://127.0.0.1:17493/speak \
-H "Content-Type: application/json" \
-H "X-Voicebox-Client-Id: my-script" \
-d '{"text": "Deploy complete.", "profile": "Morgan"}'
curl -X POST http://127.0.0.1:17493/transcribe \
-F "audio=@recording.wav" -F "model=whisper-turbo"
curl http://127.0.0.1:17493/profiles
想自己改,README 的开发者流程是:
git clone https://github.com/jamiepine/voicebox.git cd voicebox just setup # 建 Python venv,装依赖 just dev # 起后端 + 桌面端
前置依赖(README 原文):Bun、Rust、Python 3.11+、Tauri 预装项,macOS 还需 Xcode。
三、优点和缺点(先说结论:许可干净,但克隆是把双刃剑)
优点——MIT 许可,可商用可改;本地优先,隐私到位;7 个引擎随意换;桌面端用 Tauri(Rust)而不是 Electron,体积更小;API + MCP 接入顺,Agent 生态友好。
缺点与坑——下面这些大多能在 issue 里对上号:
- 声音克隆是把双刃剑:零样本几秒就能复刻任何人声,项目本身不内置同意校验或防滥用门槛,用的人要自己担法律责任与伦理风险——别拿去克隆没授权的人;
- Linux 没有预编译包,只能源码编译,门槛直接劝退一批人;
- 吃资源:TTS + 本地 LLM(Qwen3 0.6B/1.7B/4B)+ Whisper 多个模型常驻显存,CPU 能跑但明显慢;
- 真实体验摩擦集中在 issue:#120 模型下载失败、#73 在 Mac 上生成不出声音、#835 的 docker compose 因 .dockerignore 漏了 rocm-entrypoint.sh 而报错;
- Windows 安装包被趋势科技报毒(#822,疑似误报),装之前心里有数;
- 引擎各自带许可(HumeAI TADA、Qwen 等不等同于 App 的 MIT),要商用量产得逐个核对引擎许可。
四、最终能达到什么效果
本地跑通之后:把 ElevenLabs + WisprFlow 两个订阅换成自家机器;播客、有声书、游戏对话、给 Agent 配音一站搞定;听写全局热键直接贴进任意输入框。它补齐的是「语音输入输出」这一整圈闭环。
| 适合谁 | 不适合谁 |
|---|---|
| 重视隐私、想本地跑语音的人 | 只想点一下就出声、不愿折腾环境的人 |
| 已经在用 Claude Code / Cursor 这类 MCP Agent | 机器没独显、内存紧张的人 |
| 做播客 / 有声内容 / 游戏叙事的创作者 | Linux 不想编译、又要用预编译包的人 |
| 需要给自有 Agent 配声音的产品团队 | 对克隆他人声音有合规顾虑的团队 |
动手前先记三件事:① 克隆前先拿到对方授权;② 装之前确认 GPU / 内存够不够;③ Windows 遇杀软报毒先查 #822 是不是误报。
下期预告:本地语音克隆这条线横评——Voicebox / Chatterbox / Kokoro 各自定位与怎么选。
