HuggingFace Speech-to-Speech:开源语音 Agent 流水线全解析
HuggingFace Speech-to-Speech 项目封面 HuggingFace 的 speech-to-speech 项目把语音 Agent 的四个核心环节——语音活动检测(VAD)、语音转文字(STT)、大语言模型(LLM)、文字转语音(TTS)——拆成了四个独立线程,用队列串联。每个环节都开放替换,LLM 槽位兼容 OpenAI 协议,整套流…
HuggingFace Speech-to-Speech 项目封面 HuggingFace 的 speech-to-speech 项目把语音 Agent 的四个核心环节——语音活动检测(VAD)、语音转文字(STT)、大语言模型(LLM)、文字转语音(TTS)——拆成了四个独立线程,用队列串联。每个环节都开放替换,LLM 槽位兼容 OpenAI 协议,整套流…