Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成

Voicebox:一个开源项目把 ElevenLabs 和 WisprFlow 的活都干了

当 AI 语音工具的市场被两家公司分占时——ElevenLabs 主导语音合成输出,WisprFlow 主导语音听写输入——一个名为 Voicebox 的开源项目正在尝试同时覆盖这两端,并且把整套流程跑在你自己的机器上。

Voicebox 由开发者 Jamie Pine 创建,目前在 GitHub 上拥有超过 43,000 颗星,日增 star 数稳定在 600 以上,是语音 AI 领域增长最快的开源项目之一。它定位为「local-first AI voice studio」:免费、开源(MIT 许可)、本地运行,将语音克隆、多引擎文本转语音、全局听写、AI Agent 语音输出整合到一个桌面应用中。

Voicebox 应用界面

核心定位:打通语音 I/O 的双向通道

Voicebox 的设计理念可以概括为一个等式:完整的语音 I/O = 输入(STT)+ 输出(TTS)+ 中间层的 LLM 润色。

商业产品中,ElevenLabs 只做输出(TTS),WisprFlow 只做输入(听写)。Voicebox 把两者合并,并在中间加入一个本地运行的小型 LLM(Qwen3 0.6B/1.7B/4B),负责对话内容做角色化改写——让 Agent 不仅会说话,还会「以特定人设说话」。

整个技术栈不依赖任何云端服务。模型文件、语音数据、录音文件都存储在本地磁盘,不上传任何服务器。

七引擎 TTS 架构

Voicebox 最有特色的设计是不绑定单一 TTS 引擎,而是内置七种引擎,按需切换:

引擎支持语言模型大小/特点
Qwen3-TTS100.6B/1.7B,支持自然语言指令控制语速和语调
Qwen CustomVoice109 个预设音色,无需参考音频,支持自然语言风格控制
LuxTTS英语轻量约 1GB VRAM,48kHz 输出,CPU 上 150 倍实时
Chatterbox Multilingual23语言覆盖最广——阿拉伯语、芬兰语、印地语、斯瓦希里语等
Chatterbox Turbo英语350M 快速模型,支持副语言情感标签
HumeAI TADA101B/3B 语音语言模型,700 秒以上连贯音频生成
Kokoro882M 极小模型,50 个预设音色,CPU 快速推理

这种多引擎架构的实际价值在于:不同场景下最优引擎不同。需要极速 CPU 推理用 Kokoro(82M);需要广覆盖小语种用 Chatterbox Multilingual(23 种语言);需要高质量多语言克隆用 Qwen3-TTS。开发者无需在多个工具间切换,同一个界面内即可完成引擎比选。

Chatterbox Turbo 还支持副语言标签——在文本中插入 [laugh][sigh][gasp][cough] 等标签,引擎会生成对应的非语言声音,让合成语音更具表现力。

语音克隆与角色系统

Voicebox 的语音克隆采用零样本(zero-shot)方式:提供几秒钟的参考音频,即可克隆该音色。也支持多样本(multi-sample)输入以提升克隆质量。

在克隆音色之上,Voicebox 引入了「Voice Personality」概念。为每个音色附加一段自由文本描述(如「干练的英式管家」「温柔鼓励的画画老师」),内置 LLM 会根据这段人设描述,将输入文本改写成该角色的说话风格后再合成语音。

三个操作模式:

  • Compose:LLM 根据人设从零生成一句符合角色的台词
  • Speak in character:将用户输入的文本经 LLM 改写为角色语调后合成
  • Respond:基于上下文生成角色回应

这套系统对 MCP-aware 的 AI Agent(Claude Code、Cursor、Cline)同样开放——Agent 通过一次工具调用即可触发完整的「文本→人设改写→TTS」流程。

MCP 集成:给 AI Agent 一个声音

Voicebox 内置了 Model Context Protocol (MCP) 服务器,暴露四个工具:

  • voicebox.speak — 让 Agent 用克隆的声音说话
  • voicebox.transcribe — 转录音频文件
  • voicebox.list_captures — 浏览历史录音
  • voicebox.list_profiles — 列出可用音色

在 Claude Code 中一行命令即可接入:

claude mcp add voicebox \
  --transport http \
  --url http://127.0.0.1:17493/mcp \
  --header "X-Voicebox-Client-Id: claude-code"

实际使用场景:Agent 完成部署后自动语音播报「Deploy complete」,或者代码审查完毕后用指定音色汇报结果。Voicebox 支持按 MCP 客户端绑定不同音色——Claude Code 用 Morgan Freeman 的声音,Cursor 用另一个声音——开发者不用看屏幕就能区分是哪个 Agent 在说话。

为防止 Agent 在后台静默播放语音,Voicebox 设计了一个强制可见性机制:每次 Agent 发起语音时,屏幕上都会弹出状态浮标(pill),显示当前正在说话的音色名称和状态。

全局听写:输入端的另一半

听写功能覆盖了语音 I/O 的输入侧。按住全局热键说话,松开后在 macOS 上自动粘贴到当前焦点文本框。核心技术点:

  • 和弦式绑定:支持按住说话和点按切换两种模式,且可中途从按住模式无缝切换为切换模式
  • 目标感知粘贴(macOS):通过 Accessibility API 验证后注入到焦点文本框,保留并恢复剪贴板内容
  • LLM 润色:可选地清除「嗯」「啊」等口语填充词和口误后再粘贴
  • 状态浮标:录音、转录、润色、播放四个状态共用同一个屏幕浮标

STT 引擎使用 OpenAI Whisper(Base/Small/Medium/Large/Turbo),在 Apple Silicon 上跑 MLX 后端,其他平台跑 PyTorch(CUDA/ROCm/DirectML/CPU)。Turbo 模式比 Whisper Large 快约 8 倍,质量损失极小。

Stories 编辑器:多角色叙事制作

除了单次生成,Voicebox 还内置了多轨时间线编辑器(Stories Editor),用于制作多角色对话内容:

  • 多轨合成,支持拖放排列
  • 内联音频裁剪和分割
  • 同步播放头自动回放
  • 每个轨道片段可独立锁定版本

配合无限长度生成功能(文本自动按句子边界分块、独立生成、交叉淡入淡出拼接,最大支持 50,000 字符),可以制作播客、有声书、对话场景等长篇语音内容。

技术栈

Voicebox 的工程架构值得开发者关注:

技术
桌面应用Tauri (Rust),非 Electron
前端React + TypeScript + Tailwind CSS
状态管理Zustand + React Query
后端FastAPI (Python)
TTS 引擎7 个引擎(见上表)
STTWhisper / Whisper Turbo
本地 LLMQwen3 (0.6B/1.7B/4B),与 TTS/STT 共享推理运行时
MCP 服务器FastMCP,挂载在 /mcp,支持 Streamable HTTP + stdio shim
音频效果Spotify Pedalboard 库
GPU 推理MLX (Apple Silicon) / PyTorch (CUDA/ROCm/XPU)
数据库SQLite
音频处理WaveSurfer.js + librosa

选择 Tauri(Rust)而非 Electron 是一个关键架构决策——这意味着应用内存占用远低于 Electron 方案,同时 Rust 层负责全局热键、粘贴注入、焦点检测等需要系统级 API 的原生操作。

GPU 支持覆盖面也很广:Apple Silicon 用 MLX(Metal,借助 Neural Engine 可快 4-5 倍),NVIDIA 用 CUDA,AMD 用 ROCm,Intel Arc 用 IPEX/XPU,Windows 任意 GPU 用 DirectML,无 GPU 时退回 CPU。

路线图:从工具到平台

Voicebox 的公开路线图显示它正在向语音处理平台演进:

  • 端到端语音 LLM:集成 Moshi、GLM-4-Voice、Qwen2.5 Omni,实现真正的语音到语音(中间不经过文本)
  • 流水线路由:可配置的「源→变换→出口」链,支持 webhook 和 MCP 出口
  • 流式转录:WebSocket /transcribe/stream,说话时实时输出部分转录结果
  • Voice Design:从文本描述直接创建全新音色
  • 插件架构:扩展自定义模型、变换和出口

与商业方案的差异

维度ElevenLabsWisprFlowVoicebox
方向语音输出 (TTS)语音输入 (听写)双向
部署云端云端本地优先
定价按字符订阅按月订阅免费开源 (MIT)
数据隐私音频上传服务器音频上传服务器全部本地
Agent 集成APIMCP 原生
多引擎单一N/A7 个可切换

Voicebox 的核心差异化在于「本地优先 + 双向 I/O + Agent 原生」三个维度的叠加。对于重视数据隐私的用户(医疗、法律、金融场景)、需要离线工作的环境、以及希望给 AI Agent 加语音交互的开发者,它填补了商业方案留出的空白。

开发者上手

bash
git clone https://github.com/jamiepine/voicebox.git
cd voicebox

just setup   # 创建 Python venv,安装所有依赖
just dev     # 启动后端 + 桌面应用

macOS(Apple Silicon / Intel)、Windows 均有预编译安装包,Linux 暂需从源码构建。Docker 部署一行命令:docker compose up

REST API 也已开放,不使用 MCP 的场景可以直接调用:

bash
# 生成语音
curl -X POST http://127.0.0.1:17493/generate \
  -H "Content-Type: application/json" \
  -d '{"text": "Hello world", "profile_id": "abc123", "language": "en"}'

# Agent 语音输出
curl -X POST http://127.0.0.1:17493/speak \
  -H "Content-Type: application/json" \
  -H "X-Voicebox-Client-Id: my-script" \
  -d '{"text": "Deploy complete.", "profile": "Morgan"}'

Voicebox 展示了一个趋势:当开源模型(Qwen3-TTS、Whisper、Kokoro、Chatterbox)的质量逐渐接近商业 API 时,将它们整合为完整工具链的工程价值就会凸显。七引擎可切换、MCP 原生集成、本地 LLM 人设改写——这些设计决策背后的思路是:语音 AI 的竞争已经超越了单一模型质量的比拼,完整 I/O 工具链的工程整合能力正在成为新的分水岭。

推荐阅读