微软开源 VibeVoice 语音模型家族:从 7B 到 1.5B BitNet,纯 CPU 跑实时语音识别
2026 年 7 月 23 日,微软研究院发布了 VibeVoice-ASR-BitNet,将原本需要 GPU 运行的 7B 参数语音识别模型压缩到 1.58 GB,在普通 CPU 上实现了实时识别(RTF < 1),速度达到 Whisper.cpp 的 1.6 到 2.3 倍。 这是 VibeVoice 开源语音 AI 框架的最新一环。VibeVoice…
2026 年 7 月 23 日,微软研究院发布了 VibeVoice-ASR-BitNet,将原本需要 GPU 运行的 7B 参数语音识别模型压缩到 1.58 GB,在普通 CPU 上实现了实时识别(RTF < 1),速度达到 Whisper.cpp 的 1.6 到 2.3 倍。 这是 VibeVoice 开源语音 AI 框架的最新一环。VibeVoice…
本地语音转文字的开发者,长期以来面对一个尴尬的现实:能用的推理栈屈指可数。OpenAI 的 Whisper 有官方 Python 实现和社区维护的 whisper.cpp,NVIDIA 的 Parakeet 和 Canary 必须跑在笨重的 NeMo PyTorch 框架上,想上 GPU 加速还要自己折腾 ONNX 转换。每换一个模型家族,就要重写一遍部署管…