Speech-to-Speech:用开源模型搭建低延迟实时语音智能体
随着大语言模型技术的快速发展,语音交互正从传统的命令控制模式向智能化对话演进。如何实现低延迟、高可用的实时语音对话,成为众多开发者关注的核心问题。Hugging Face近期开源的speech-to-speech框架,采用Apache-2.0协议,基于Python 3.10+实现了一套完整的低延迟级联语音处理架构,为开发者提供了从理论到实践的完整解决方案。
核心模块详解与模型选型
该框架的核心架构采用六级线程处理链设计,通过类型化队列将各阶段解耦:VAD(语音活动检测)→ STT(语音转文本)→ TranscriptionNotifier(转写通知)→ LLM(大语言模型)→ LMOutputProcessor(输出处理)→ TTS(文本转语音)。这种模块化设计的最大优势在于模型槽位可替换,开发者可根据实际需求灵活组合不同模型。
LLM与TTS的灵活配置
在语音活动检测环节,默认采用Silero VAD v5,支持动态阈值调节、语音静音时长配置、短段合并以及可选的DeepFilterNet降噪处理。默认阈值设为0.6,最短语音、续说、静音时间分别为384ms、192ms、64ms。STT模块默认使用Parakeet TDN,支持25种欧洲语言;非macOS系统使用nano-parakeet,Mac系统则采用MLX版本。开发者也可选配Faster-Whisper、Lightning Whisper MLX或FunASR Paraformer等模型,其中Paraformer对中文支持更为友好。
最有价值的不是默认模型,而是把并发、插话、流式输出、工具回路和运行时配置做成可读、可换的工程结构。
“技术洞察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
四种运行模式与部署策略
LLM模块支持灵活部署,本地可使用Transformers或MLX-LM,云端则可对接OpenAI、HF Providers、OpenRouter、vLLM或llama.cpp。该模块原生支持流式/非流式输出、图像/VLM理解、会话窗口管理、工具调用以及token统计。TTS默认集成Qwen3-TTS,Linux/Windows平台使用GGML/torch后端,Mac平台使用mlx-audio后端,支持预设音色、声音克隆和VoiceDesign功能。此外还支持Kokoro、ChatTTS、MMS等多种TTS方案。
插话打断与代际取消机制
框架提供四种运行模式以适应不同场景:realtime模式提供OpenAI Realtime兼容接口;local模式直连麦克风和扬声器;raw-websocket模式处理16kHz int16单声道PCM数据;socket模式以双TCP端口分离音频收放。延迟优化需重点关注三个参数:VAD的min_silence_ms决定何时交棒给下游,LLM的stream_batch_sentences控制文本批次大小,TTS的chunk参数影响首音频输出时间。对于长对话场景,建议开启compact_history以压缩历史上下文。
如有侵权,请联系删除。
