Voicebox:一个开源项目把 ElevenLabs 和 WisprFlow 的活都干了
当 AI 语音工具的市场被两家公司分占时——ElevenLabs 主导语音合成输出,WisprFlow 主导语音听写输入——一个名为 Voicebox 的开源项目正在尝试同时覆盖这两端,并且把整套流程跑在你自己的机器上。
Voicebox 由开发者 Jamie Pine 创建,目前在 GitHub 上拥有超过 43,000 颗星,日增 star 数稳定在 600 以上,是语音 AI 领域增长最快的开源项目之一。它定位为「local-first AI voice studio」:免费、开源(MIT 许可)、本地运行,将语音克隆、多引擎文本转语音、全局听写、AI Agent 语音输出整合到一个桌面应用中。

核心定位:打通语音 I/O 的双向通道
Voicebox 的设计理念可以概括为一个等式:完整的语音 I/O = 输入(STT)+ 输出(TTS)+ 中间层的 LLM 润色。
商业产品中,ElevenLabs 只做输出(TTS),WisprFlow 只做输入(听写)。Voicebox 把两者合并,并在中间加入一个本地运行的小型 LLM(Qwen3 0.6B/1.7B/4B),负责对话内容做角色化改写——让 Agent 不仅会说话,还会「以特定人设说话」。
整个技术栈不依赖任何云端服务。模型文件、语音数据、录音文件都存储在本地磁盘,不上传任何服务器。
七引擎 TTS 架构
Voicebox 最有特色的设计是不绑定单一 TTS 引擎,而是内置七种引擎,按需切换:
| 引擎 | 支持语言 | 模型大小/特点 |
|---|---|---|
| Qwen3-TTS | 10 | 0.6B/1.7B,支持自然语言指令控制语速和语调 |
| Qwen CustomVoice | 10 | 9 个预设音色,无需参考音频,支持自然语言风格控制 |
| LuxTTS | 英语 | 轻量约 1GB VRAM,48kHz 输出,CPU 上 150 倍实时 |
| Chatterbox Multilingual | 23 | 语言覆盖最广——阿拉伯语、芬兰语、印地语、斯瓦希里语等 |
| Chatterbox Turbo | 英语 | 350M 快速模型,支持副语言情感标签 |
| HumeAI TADA | 10 | 1B/3B 语音语言模型,700 秒以上连贯音频生成 |
| Kokoro | 8 | 82M 极小模型,50 个预设音色,CPU 快速推理 |
这种多引擎架构的实际价值在于:不同场景下最优引擎不同。需要极速 CPU 推理用 Kokoro(82M);需要广覆盖小语种用 Chatterbox Multilingual(23 种语言);需要高质量多语言克隆用 Qwen3-TTS。开发者无需在多个工具间切换,同一个界面内即可完成引擎比选。
Chatterbox Turbo 还支持副语言标签——在文本中插入 [laugh]、[sigh]、[gasp]、[cough] 等标签,引擎会生成对应的非语言声音,让合成语音更具表现力。
语音克隆与角色系统
Voicebox 的语音克隆采用零样本(zero-shot)方式:提供几秒钟的参考音频,即可克隆该音色。也支持多样本(multi-sample)输入以提升克隆质量。
在克隆音色之上,Voicebox 引入了「Voice Personality」概念。为每个音色附加一段自由文本描述(如「干练的英式管家」「温柔鼓励的画画老师」),内置 LLM 会根据这段人设描述,将输入文本改写成该角色的说话风格后再合成语音。
三个操作模式:
- Compose:LLM 根据人设从零生成一句符合角色的台词
- Speak in character:将用户输入的文本经 LLM 改写为角色语调后合成
- Respond:基于上下文生成角色回应
这套系统对 MCP-aware 的 AI Agent(Claude Code、Cursor、Cline)同样开放——Agent 通过一次工具调用即可触发完整的「文本→人设改写→TTS」流程。
MCP 集成:给 AI Agent 一个声音
Voicebox 内置了 Model Context Protocol (MCP) 服务器,暴露四个工具:
voicebox.speak— 让 Agent 用克隆的声音说话voicebox.transcribe— 转录音频文件voicebox.list_captures— 浏览历史录音voicebox.list_profiles— 列出可用音色
在 Claude Code 中一行命令即可接入:
claude mcp add voicebox \
--transport http \
--url http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"实际使用场景:Agent 完成部署后自动语音播报「Deploy complete」,或者代码审查完毕后用指定音色汇报结果。Voicebox 支持按 MCP 客户端绑定不同音色——Claude Code 用 Morgan Freeman 的声音,Cursor 用另一个声音——开发者不用看屏幕就能区分是哪个 Agent 在说话。
为防止 Agent 在后台静默播放语音,Voicebox 设计了一个强制可见性机制:每次 Agent 发起语音时,屏幕上都会弹出状态浮标(pill),显示当前正在说话的音色名称和状态。
全局听写:输入端的另一半
听写功能覆盖了语音 I/O 的输入侧。按住全局热键说话,松开后在 macOS 上自动粘贴到当前焦点文本框。核心技术点:
- 和弦式绑定:支持按住说话和点按切换两种模式,且可中途从按住模式无缝切换为切换模式
- 目标感知粘贴(macOS):通过 Accessibility API 验证后注入到焦点文本框,保留并恢复剪贴板内容
- LLM 润色:可选地清除「嗯」「啊」等口语填充词和口误后再粘贴
- 状态浮标:录音、转录、润色、播放四个状态共用同一个屏幕浮标
STT 引擎使用 OpenAI Whisper(Base/Small/Medium/Large/Turbo),在 Apple Silicon 上跑 MLX 后端,其他平台跑 PyTorch(CUDA/ROCm/DirectML/CPU)。Turbo 模式比 Whisper Large 快约 8 倍,质量损失极小。
Stories 编辑器:多角色叙事制作
除了单次生成,Voicebox 还内置了多轨时间线编辑器(Stories Editor),用于制作多角色对话内容:
- 多轨合成,支持拖放排列
- 内联音频裁剪和分割
- 同步播放头自动回放
- 每个轨道片段可独立锁定版本
配合无限长度生成功能(文本自动按句子边界分块、独立生成、交叉淡入淡出拼接,最大支持 50,000 字符),可以制作播客、有声书、对话场景等长篇语音内容。
技术栈
Voicebox 的工程架构值得开发者关注:
| 层 | 技术 |
|---|---|
| 桌面应用 | Tauri (Rust),非 Electron |
| 前端 | React + TypeScript + Tailwind CSS |
| 状态管理 | Zustand + React Query |
| 后端 | FastAPI (Python) |
| TTS 引擎 | 7 个引擎(见上表) |
| STT | Whisper / Whisper Turbo |
| 本地 LLM | Qwen3 (0.6B/1.7B/4B),与 TTS/STT 共享推理运行时 |
| MCP 服务器 | FastMCP,挂载在 /mcp,支持 Streamable HTTP + stdio shim |
| 音频效果 | Spotify Pedalboard 库 |
| GPU 推理 | MLX (Apple Silicon) / PyTorch (CUDA/ROCm/XPU) |
| 数据库 | SQLite |
| 音频处理 | WaveSurfer.js + librosa |
选择 Tauri(Rust)而非 Electron 是一个关键架构决策——这意味着应用内存占用远低于 Electron 方案,同时 Rust 层负责全局热键、粘贴注入、焦点检测等需要系统级 API 的原生操作。
GPU 支持覆盖面也很广:Apple Silicon 用 MLX(Metal,借助 Neural Engine 可快 4-5 倍),NVIDIA 用 CUDA,AMD 用 ROCm,Intel Arc 用 IPEX/XPU,Windows 任意 GPU 用 DirectML,无 GPU 时退回 CPU。
路线图:从工具到平台
Voicebox 的公开路线图显示它正在向语音处理平台演进:
- 端到端语音 LLM:集成 Moshi、GLM-4-Voice、Qwen2.5 Omni,实现真正的语音到语音(中间不经过文本)
- 流水线路由:可配置的「源→变换→出口」链,支持 webhook 和 MCP 出口
- 流式转录:WebSocket
/transcribe/stream,说话时实时输出部分转录结果 - Voice Design:从文本描述直接创建全新音色
- 插件架构:扩展自定义模型、变换和出口
与商业方案的差异
| 维度 | ElevenLabs | WisprFlow | Voicebox |
|---|---|---|---|
| 方向 | 语音输出 (TTS) | 语音输入 (听写) | 双向 |
| 部署 | 云端 | 云端 | 本地优先 |
| 定价 | 按字符订阅 | 按月订阅 | 免费开源 (MIT) |
| 数据隐私 | 音频上传服务器 | 音频上传服务器 | 全部本地 |
| Agent 集成 | API | 无 | MCP 原生 |
| 多引擎 | 单一 | N/A | 7 个可切换 |
Voicebox 的核心差异化在于「本地优先 + 双向 I/O + Agent 原生」三个维度的叠加。对于重视数据隐私的用户(医疗、法律、金融场景)、需要离线工作的环境、以及希望给 AI Agent 加语音交互的开发者,它填补了商业方案留出的空白。
开发者上手
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
just setup # 创建 Python venv,安装所有依赖
just dev # 启动后端 + 桌面应用macOS(Apple Silicon / Intel)、Windows 均有预编译安装包,Linux 暂需从源码构建。Docker 部署一行命令:docker compose up。
REST API 也已开放,不使用 MCP 的场景可以直接调用:
# 生成语音
curl -X POST http://127.0.0.1:17493/generate \
-H "Content-Type: application/json" \
-d '{"text": "Hello world", "profile_id": "abc123", "language": "en"}'
# Agent 语音输出
curl -X POST http://127.0.0.1:17493/speak \
-H "Content-Type: application/json" \
-H "X-Voicebox-Client-Id: my-script" \
-d '{"text": "Deploy complete.", "profile": "Morgan"}'Voicebox 展示了一个趋势:当开源模型(Qwen3-TTS、Whisper、Kokoro、Chatterbox)的质量逐渐接近商业 API 时,将它们整合为完整工具链的工程价值就会凸显。七引擎可切换、MCP 原生集成、本地 LLM 人设改写——这些设计决策背后的思路是:语音 AI 的竞争已经超越了单一模型质量的比拼,完整 I/O 工具链的工程整合能力正在成为新的分水岭。