By 小墨
2026年3月25日
75
848
通用语音识别模型VibeVoice ASR:60分钟长音频一键转写结构化输出
语音识别技术在近年来取得了飞速发展,但在面对真实复杂场景时,许多系统依然显得力不从心:漫长的会议记录、多人混杂的交谈、专业的行业术语,或是中英夹杂的日常对话。传统语音识别系统往往需要将长音频切分成短小片段,分别识别后再费力地“拼凑”起来,这种“化整为零”的方法不仅容易丢失上下文,还常常在谁说了什么、什么时候说的等问题上张冠李戴。
五大核心能力
近日,微软亚洲研究院发布了一款通用语音识别模型VibeVoice ASR,单次转录可处理长达60分钟的连续音频,并能够可靠地生成丰富、结构化的输出,清晰记录说话者身份及其说话时间。作为一种全新的语音识别范式,VibeVoice ASR将长语音理解视为首要问题,而非用碎片化步骤的简单拼接对其加以处理。
性能超越与创新架构
首先,VibeVoice ASR支持60分钟音频一次性转录,完美保留长上下文和说话人一致性,彻底告别手动切片或繁琐的后期结果拼接。其次,模型输出的文本高度结构化,结合自动语音识别、说话人记录和时间戳功能,清晰标注了“谁、在什么时候、说了什么”,只需少量后期处理即可。第三,用户可在转录请求中直接注入特定领域的专业词汇、专有名词或生僻技术术语,大幅提升了垂直领域的识别准确度。第四,VibeVoice ASR原生支持50多种语言,且支持无缝的语种切换(如中英混杂对话),用户无需在调用前手动配置语言。第五,也是最核心的一点:模型巧妙地将声学和语义音频分词器与大语言模型解码器相结合,真正实现了具备长上下文理解能力的语音理解。
真正的技术创新不是功能的简单叠加,而是对根本性问题的重新定义。
“科技观察者”实测表现
在包括AISHELL-4、AMI和AliMeeting在内的五项权威基准测试中,VibeVoice ASR的性能一致超越了此前领先的闭源多模态大模型。在说话人归属准确性方面,VibeVoice ASR的DER(说话人错误率)降至3.42%,远优于对比模型的16.29%。在综合评估“谁、何时、说了什么”的tcpWER指标上,VibeVoice ASR以14.81%的表现大幅领先,解决了长音频中常见的时间戳偏移问题。
开发者友好
VibeVoice ASR现已完全集成到Hugging Face Transformers生态系统中,并可通过Microsoft Foundry模型目录轻松检索。开发者可以使用自己熟悉的工具,轻松进行实验、评估和部署。这种开放的姿态无疑将加速语音识别技术的普及和应用创新。
如有侵权,请联系删除。
Related Articles
-
Wed Apr 15 2026腾讯云率先支持 Hermes Agent 云端快速部署
Hermes Agent 作为近月内走红的开源智能体项目,强调可成长性和持久记忆,并引入自我学习与技能自主创建机制。腾讯云在其轻量应用服务器 Lighthouse 上上线了专属应用模板,支持一键云端快
-
Tue Apr 14 20264月17日深圳见!观测云携手百胜软件,解锁 AI Agent 驱动的可观测性新范式
观测云与百胜软件将在深圳联合举办主题为“AI Agent驱动的可观测性新范式”的技术活动,旨在探讨如何借助智能体将海量技术指标转化为可执行的业务洞察。
-
Tue Apr 14 2026【热点速递汇编】EdgeRunner AI公司为美国太空军开发专用 AI智能体
EdgeRunner AI赢得美国太空军合同,将为其提供专用的端侧AI智能体,旨在在通信受限或中断环境中仍能为人员提供可靠的智能支持。
-
Tue Apr 14 2026【TV最前线】布局人工智能领域,中国广电四川公司发布四款AI产品
中国广电四川公司在2026年推出四款AI产品,覆盖大屏、康养、竞赛与运维等场景,强调私有化与本地化部署保障用户数据不出域。
-
Tue Apr 14 2026斯坦福HAI最新报告出炉:中国模型追平美国,95%企业AI投资零回报
斯坦福大学人类中心人工智能研究所(HAI)发布了2026年AI指数报告,报告通过多维指标评估全球AI发展态势,指出在模型性能、学术产出和产业应用等方面,中国取得显著进展,与美国在若干任务上差距明显缩小
-
Mon Apr 13 2026Anthropic 推出 Claude for Word 公测版,原生嵌入微软 Office 编辑流程/MiniMax 开源 229B 参数 M2.7 模型
Anthropic 发布了 Claude for Word 公测版,作为原生侧边栏插件它可以嵌入 Microsoft Word 编辑流程,为用户提供上下文感知的编辑建议与文档处理能力。
