英伟达开源全双工语音AI:448ms延迟支持实时打断,边说话边调用工具
用过语音助手的人大概都有过这样的体验:话说一半发现表达有误,想立刻纠正,但助手已经完全切换到"回答模式",根本不理你。这种尴尬的等待暴露了一个根本问题——目前绝大多数语音AI本质上仍是"对讲机模式":一方说完,另一方再说,严格轮流,从未真正实现双向同时对话。
突破性的全双工语音交互
英伟达最新开源的NemotronLabs VoiceChat 11B模型首次在开源领域实现了真正的全双工语音对话能力。与传统串行架构不同,该模型能够在用户说话的同时就开始理解内容并准备回应,用户随时可以打断它,模型会立即让出话语权。从技术指标来看,其轮换延迟仅为448毫秒,比人类日常对话中的自然停顿还要短,这意味着交互体验已经接近人与人之间的自然交流状态。
统一架构:合并ASR、LLM、TTS三大模块
传统语音AI系统通常由语音识别(ASR)、大语言模型(LLM)、语音合成(TTS)三个独立模块串联而成,每一环节都需要等待前一环节完成,加上模块间的数据转换开销,总延迟往往高达一两秒。更关键的是,这种串行架构导致"说话时无法聆听",自然也就谈不上实时打断了。VoiceChat 11B的创新在于将这三个模块整合为统一架构,采用端到端联合训练,音频输入直接对应音频输出,彻底消除了模块间的拆包重组延迟。
语音是人类最自然的交流方式。我们花了几十年让计算机能"听懂"我们说什么。现在,也许终于有机会,让它学会真正和我们说话。
“技术观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
Mamba与Transformer混合架构
在模型架构层面,VoiceChat 11B采用了独特的混合设计。语音编码器使用Fast Conformer架构,将16kHz原始音频流实时压缩为音频token序列,整个过程持续流式运行。LLM主干基于Nemotron Nano V2(9B参数),创新性地结合了Mamba的状态空间模型与Transformer的注意力机制——Mamba处理长序列时的线性复杂度保障了低延迟,而Transformer的注意力机制则维持了对对话上下文的深度理解能力。TTS解码器负责将LLM生成的文本token实时转换为22.05kHz语音输出,由于采用流式token生成策略,TTS可以边接收边合成,无需等待完整句子生成完毕,这正是实现450ms超低延迟的关键技术细节。
实时工具调用:边说边查的智能助理
VoiceChat 11B最具颠覆性的特性是支持实时工具调用能力。当用户在对话过程中提出需要查询信息的请求时,系统不会停下来等待,而是继续说出"好的,我帮您查一下"这类占位语,同时在后台异步调用天气、搜索等外部接口。工具返回结果后,数据会无缝衔接进对话流中。从性能基准测试来看,在Full-Duplex-Bench 1.0上,该模型的轮换成功率高达0.82,用户打断成功率接近满分1.00,打断响应延迟仅480ms,打断质量获得GPT-4o评分4.33分(满分5分)。工具调用方面,单一工具调用准确率为58.5%,多工具调用62.5%,并行调用42.5%,无关请求拒绝率为89.6%。尽管并行工具调用还有提升空间,但作为首个开源实现,这已是里程碑级别的成果。
如有侵权,请联系删除。
