判断先给:ElevenLabs 管输出、WisprFlow 管输入,两家都要订阅。Voicebox 把「说」和「听」做成了同一个本地优先的开源工作室——模型、声音样本、录音全不离开你的机器,许可是干净的 MIT,可以商用、可以改。但它最猛的能力(几秒音频复刻任意人声)也正是最大的雷,下面细说。

一、它到底能做什么

一句话:一个跑在你自己电脑上的 AI 语音工作室,克隆声音、生成语音、全局听写、给 AI Agent 配一个你拥有的声音,这四件事在一个 App 里全做了。它把自己定位成 ElevenLabs 和 WisprFlow 两个云产品的本地开源替代。

引擎语言特点
Qwen3-TTS (0.6B / 1.7B)10高质量多语克隆,支持「说得慢一点」「小声说」这类指令
Qwen CustomVoice109 个预设音色,自然语言控制语气,无需参考音频
LuxTTS英语轻量约 1GB 显存,CPU 上 150 倍实时
Chatterbox Multilingual23语种覆盖最广
Chatterbox Turbo英语3.5 亿小模型,支持 [laugh] [sigh] 等情绪标签
HumeAI TADA (1B / 3B)10语音-语言模型,700 秒以上连贯音频
Kokoro88200 万极小模型,50 个预设音色,CPU 快

二、怎么用(命令均取自 README 原文)

普通用户直接下安装包,开发者用源码跑:

平台获取方式
macOS (Apple Silicon)下载 DMG(voicebox.sh/download/mac-arm)
macOS (Intel)下载 DMG(voicebox.sh/download/mac-intel)
Windows下载 MSI(voicebox.sh/download/windows)
Dockerdocker compose up
Linux暂无预编译二进制,需按 voicebox.sh/linux-install 从源码编译

把声音接进 Claude Code(MCP,逐字照抄 README):

claude mcp add voicebox \
  --transport http \
  --url http://127.0.0.1:17493/mcp \
  --header "X-Voicebox-Client-Id: claude-code"

REST API 也直接可用(部分示例):

curl -X POST http://127.0.0.1:17493/generate \
  -H "Content-Type: application/json" \
  -d '{"text": "Hello world", "profile_id": "abc123", "language": "en"}'

curl -X POST http://127.0.0.1:17493/speak \
  -H "Content-Type: application/json" \
  -H "X-Voicebox-Client-Id: my-script" \
  -d '{"text": "Deploy complete.", "profile": "Morgan"}'

curl -X POST http://127.0.0.1:17493/transcribe \
  -F "audio=@recording.wav" -F "model=whisper-turbo"

curl http://127.0.0.1:17493/profiles

想自己改,README 的开发者流程是:

git clone https://github.com/jamiepine/voicebox.git
cd voicebox
just setup   # 建 Python venv,装依赖
just dev     # 起后端 + 桌面端
前置依赖(README 原文):Bun、Rust、Python 3.11+、Tauri 预装项,macOS 还需 Xcode。

三、优点和缺点(先说结论:许可干净,但克隆是把双刃剑)

优点——MIT 许可,可商用可改;本地优先,隐私到位;7 个引擎随意换;桌面端用 Tauri(Rust)而不是 Electron,体积更小;API + MCP 接入顺,Agent 生态友好。

缺点与坑——下面这些大多能在 issue 里对上号:

四、最终能达到什么效果

本地跑通之后:把 ElevenLabs + WisprFlow 两个订阅换成自家机器;播客、有声书、游戏对话、给 Agent 配音一站搞定;听写全局热键直接贴进任意输入框。它补齐的是「语音输入输出」这一整圈闭环。

适合谁不适合谁
重视隐私、想本地跑语音的人只想点一下就出声、不愿折腾环境的人
已经在用 Claude Code / Cursor 这类 MCP Agent机器没独显、内存紧张的人
做播客 / 有声内容 / 游戏叙事的创作者Linux 不想编译、又要用预编译包的人
需要给自有 Agent 配声音的产品团队对克隆他人声音有合规顾虑的团队
动手前先记三件事:① 克隆前先拿到对方授权;② 装之前确认 GPU / 内存够不够;③ Windows 遇杀软报毒先查 #822 是不是误报。
下期预告:本地语音克隆这条线横评——Voicebox / Chatterbox / Kokoro 各自定位与怎么选。