Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成
Voicebox:一个开源项目把 ElevenLabs 和 WisprFlow 的活都干了
当 AI 语音工具的市场被两家公司分占时——ElevenLabs 主导语音合成输出,WisprFlow 主导语音听写输入——一个名为 Voicebox 的开源项目正在尝试同时覆盖这两端,并且把整套流程跑在你自己的机器上。
Voicebox 由开发者 Jamie Pine 创建,目前在 GitHub 上拥有超过 43,000 颗星,日增 star 数稳定在 600 以上,是语音 AI 领域增长最快的开源项目之一。它定位为「local-first AI voice studio」:免费、开源(MIT 许可)、本地运行,将语音克隆、多引擎文本转语音、全局听写、AI Agent 语音输出整合到一个桌面应用中。

核心定位:打通语音 I/O 的双向通道
Voicebox 的设计理念可以概括为一个等式:完整的语音 I/O = 输入(STT)+ 输出(TTS)+ 中间层的 LLM 润色。
商业产品中,ElevenLabs 只做输出(TTS),WisprFlow 只做输入(听写)。Voicebox 把两者合并,并在中间加入一个本地运行的小型 LLM(Qwen3 0.6B/1.7B/4B),负责对话内容做角色化改写——让 Agent 不仅会说话,还会「以特定人设说话」。
整个技术栈不依赖任何云端服务。模型文件、语音数据、录音文件都存储在本地磁盘,不上传任何服务器。
七引擎 TTS 架构
Voicebox 最有特色的设计是不绑定单一 TTS 引擎,而是内置七种引擎,按需切换:
| 引擎 | 支持语言 | 模型大小/特点 |
|---|---|---|
| Qwen3-TTS | 10 | 0.6B/1.7B,支持自然语言指令控制语速和语调 |
| Qwen CustomVoice | 10 | 9 个预设音色,无需参考音频,支持自然语言风格控制 |
| LuxTTS | 英语 | 轻量约 1GB VRAM,48kHz 输出,CPU 上 150 倍实时 |
| Chatterbox Multilingual | 23 | 语言覆盖最广——阿拉伯语、芬兰语、印地语、斯瓦希里语等 |
| Chatterbox Turbo | 英语 | 350M 快速模型,支持副语言情感标签 |
| HumeAI TADA | 10 | 1B/3B 语音语言模型,700 秒以上连贯音频生成 |
| Kokoro | 8 | 82M 极小模型,50 个预设音色,CPU 快速推理 |
这种多引擎架构的实际价值在于:不同场景下最优引擎不同。需要极速 CPU 推理用 Kokoro(82M);需要广覆盖小语种用 Chatterbox Multilingual(23 种语言);需要高质量多语言克隆用 Qwen3-TTS。开发者无需在多个工具间切换,同一个界面内即可完成引擎比选。
Chatterbox Turbo 还支持副语言标签——在文本中插入 [laugh]、[sigh]、[gasp]、[cough] 等标签,引擎会生成对应的非语言声音,让合成语音更具表现力。
语音克隆与角色系统
Voicebox 的语音克隆采用零样本(zero-shot)方式:提供几秒钟的参考音频,即可克隆该音色。也支持多样本(multi-sample)输入以提升克隆质量。
在克隆音色之上,Voicebox 引入了「Voice Personality」概念。为每个音色附加一段自由文本描述(如「干练的英式管家」「温柔鼓励的画画老师」),内置 LLM 会根据这段人设描述,将输入文本改写成该角色的说话风格后再合成语音。
三个操作模式:
- Compose:LLM 根据人设从零生成一句符合角色的台词
- Speak in character:将用户输入的文本经 LLM 改写为角色语调后合成
- Respond:基于上下文生成角色回应
这套系统对 MCP-aware 的 AI Agent(Claude Code、Cursor、Cline)同样开放——Agent 通过一次工具调用即可触发完整的「文本→人设改写→TTS」流程。
MCP 集成:给 AI Agent 一个声音
Voicebox 内置了 Model Context Protocol (MCP) 服务器,暴露四个工具:
voicebox.speak— 让 Agent 用克隆的声音说话voicebox.transcribe— 转录音频文件voicebox.list_captures— 浏览历史录音voicebox.list_profiles— 列出可用音色
在 Claude Code 中一行命令即可接入:
claude mcp add voicebox \ --transport http \ --url http://127.0.0.1:17493/mcp \ --header "X-Voicebox-Client-Id: claude-code"
实际使用场景:Agent 完成部署后自动语音播报「Deploy complete」,或者代码审查完毕后用指定音色汇报结果。Voicebox 支持按 MCP 客户端绑定不同音色——Claude Code 用 Morgan Freeman 的声音,Cursor 用另一个声音——开发者不用看屏幕就能区分是哪个 Agent 在说话。
为防止 Agent 在后台静默播放语音,Voicebox 设计了一个强制可见性机制:每次 Agent 发起语音时,屏幕上都会弹出状态浮标(pill),显示当前正在说话的音色名称和状态。
全局听写:输入端的另一半
听写功能覆盖了语音 I/O 的输入侧。按住全局热键说话,松开后在 macOS 上自动粘贴到当前焦点文本框。核心技术点:
- 和弦式绑定:支持按住说话和点按切换两种模式,且可中途从按住模式无缝切换为切换模式
- 目标感知粘贴(macOS):通过 Accessibility API 验证后注入到焦点文本框,保留并恢复剪贴板内容
- LLM 润色:可选地清除「嗯」「啊」等口语填充词和口误后再粘贴
- 状态浮标:录音、转录、润色、播放四个状态共用同一个屏幕浮标
STT 引擎使用 OpenAI Whisper(Base/Small/Medium/Large/Turbo),在 Apple Silicon 上跑 MLX 后端,其他平台跑 PyTorch(CUDA/ROCm/DirectML/CPU)。Turbo 模式比 Whisper Large 快约 8 倍,质量损失极小。
Stories 编辑器:多角色叙事制作
除了单次生成,Voicebox 还内置了多轨时间线编辑器(Stories Editor),用于制作多角色对话内容:
- 多轨合成,支持拖放排列
- 内联音频裁剪和分割
- 同步播放头自动回放
- 每个轨道片段可独立锁定版本
配合无限长度生成功能(文本自动按句子边界分块、独立生成、交叉淡入淡出拼接,最大支持 50,000 字符),可以制作播客、有声书、对话场景等长篇语音内容。
技术栈
Voicebox 的工程架构值得开发者关注:
| 层 | 技术 |
|---|---|
| 桌面应用 | Tauri (Rust),非 Electron |
| 前端 | React + TypeScript + Tailwind CSS |
| 状态管理 | Zustand + React Query |
| 后端 | FastAPI (Python) |
| TTS 引擎 | 7 个引擎(见上表) |
| STT | Whisper / Whisper Turbo |
| 本地 LLM | Qwen3 (0.6B/1.7B/4B),与 TTS/STT 共享推理运行时 |
| MCP 服务器 | FastMCP,挂载在 /mcp,支持 Streamable HTTP + stdio shim |
| 音频效果 | Spotify Pedalboard 库 |
| GPU 推理 | MLX (Apple Silicon) / PyTorch (CUDA/ROCm/XPU) |
| 数据库 | SQLite |
| 音频处理 | WaveSurfer.js + librosa |
选择 Tauri(Rust)而非 Electron 是一个关键架构决策——这意味着应用内存占用远低于 Electron 方案,同时 Rust 层负责全局热键、粘贴注入、焦点检测等需要系统级 API 的原生操作。
GPU 支持覆盖面也很广:Apple Silicon 用 MLX(Metal,借助 Neural Engine 可快 4-5 倍),NVIDIA 用 CUDA,AMD 用 ROCm,Intel Arc 用 IPEX/XPU,Windows 任意 GPU 用 DirectML,无 GPU 时退回 CPU。
路线图:从工具到平台
Voicebox 的公开路线图显示它正在向语音处理平台演进:
- 端到端语音 LLM:集成 Moshi、GLM-4-Voice、Qwen2.5 Omni,实现真正的语音到语音(中间不经过文本)
- 流水线路由:可配置的「源→变换→出口」链,支持 webhook 和 MCP 出口
- 流式转录:WebSocket
/transcribe/stream,说话时实时输出部分转录结果 - Voice Design:从文本描述直接创建全新音色
- 插件架构:扩展自定义模型、变换和出口
与商业方案的差异
| 维度 | ElevenLabs | WisprFlow | Voicebox |
|---|---|---|---|
| 方向 | 语音输出 (TTS) | 语音输入 (听写) | 双向 |
| 部署 | 云端 | 云端 | 本地优先 |
| 定价 | 按字符订阅 | 按月订阅 | 免费开源 (MIT) |
| 数据隐私 | 音频上传服务器 | 音频上传服务器 | 全部本地 |
| Agent 集成 | API | 无 | MCP 原生 |
| 多引擎 | 单一 | N/A | 7 个可切换 |
Voicebox 的核心差异化在于「本地优先 + 双向 I/O + Agent 原生」三个维度的叠加。对于重视数据隐私的用户(医疗、法律、金融场景)、需要离线工作的环境、以及希望给 AI Agent 加语音交互的开发者,它填补了商业方案留出的空白。
开发者上手
bashgit clone https://github.com/jamiepine/voicebox.git cd voicebox just setup # 创建 Python venv,安装所有依赖 just dev # 启动后端 + 桌面应用
macOS(Apple Silicon / Intel)、Windows 均有预编译安装包,Linux 暂需从源码构建。Docker 部署一行命令:docker compose up。
REST API 也已开放,不使用 MCP 的场景可以直接调用:
bash# 生成语音 curl -X POST http://127.0.0.1:17493/generate \ -H "Content-Type: application/json" \ -d '{"text": "Hello world", "profile_id": "abc123", "language": "en"}' # Agent 语音输出 curl -X POST http://127.0.0.1:17493/speak \ -H "Content-Type: application/json" \ -H "X-Voicebox-Client-Id: my-script" \ -d '{"text": "Deploy complete.", "profile": "Morgan"}'
Voicebox 展示了一个趋势:当开源模型(Qwen3-TTS、Whisper、Kokoro、Chatterbox)的质量逐渐接近商业 API 时,将它们整合为完整工具链的工程价值就会凸显。七引擎可切换、MCP 原生集成、本地 LLM 人设改写——这些设计决策背后的思路是:语音 AI 的竞争已经超越了单一模型质量的比拼,完整 I/O 工具链的工程整合能力正在成为新的分水岭。
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- xAI 开源 Grok Build:Rust 编写的终端编程代理7/15/2026
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
- Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分7/3/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试6/26/2026
- Claude Code 被指通过 system prompt 隐蔽传递代理与时区信息6/30/2026
- 苹果首款触屏 MacBook 确认搭载 M5 Pro/Max,M7 版计划 2027 年跟进6/27/2026
- 华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码7/20/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商7/20/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS7/18/2026
- LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧7/18/2026
- 马斯克:AI 和机器人将让工作变为可选,实现全民高收入7/3/2026
- Kimi K3:2.8万亿参数开源模型,前端编程Arena登顶7/17/2026
- 香港处理中国过半芯片进口创历史新高:AI贸易重塑亚洲供应链7/5/2026
- Linux登顶2026 CVE漏洞榜:内核维护者称这是好事7/4/2026
- 2026 年 AI 都学会了记忆,但你的记忆不属于你7/19/2026
- transcribe.cpp:一个 ggml 运行时跑完 16 个语音转文字模型家族7/19/2026
- 从老鼠视皮层还原10秒视频:大脑视觉编码研究的里程碑7/13/2026
- Meta大脑读心术:非侵入式脑机接口解码句子准确率创新高7/11/2026
- F-Droid将Google ADV定性为恶意软件:40亿设备已被预装7/5/2026