2026年3月25日

848

通用语音识别模型VibeVoice ASR：60分钟长音频一键转写结构化输出

语音识别技术在近年来取得了飞速发展，但在面对真实复杂场景时，许多系统依然显得力不从心：漫长的会议记录、多人混杂的交谈、专业的行业术语，或是中英夹杂的日常对话。传统语音识别系统往往需要将长音频切分成短小片段，分别识别后再费力地“拼凑”起来，这种“化整为零”的方法不仅容易丢失上下文，还常常在谁说了什么、什么时候说的等问题上张冠李戴。

五大核心能力

近日，微软亚洲研究院发布了一款通用语音识别模型VibeVoice ASR，单次转录可处理长达60分钟的连续音频，并能够可靠地生成丰富、结构化的输出，清晰记录说话者身份及其说话时间。作为一种全新的语音识别范式，VibeVoice ASR将长语音理解视为首要问题，而非用碎片化步骤的简单拼接对其加以处理。

性能超越与创新架构

首先，VibeVoice ASR支持60分钟音频一次性转录，完美保留长上下文和说话人一致性，彻底告别手动切片或繁琐的后期结果拼接。其次，模型输出的文本高度结构化，结合自动语音识别、说话人记录和时间戳功能，清晰标注了“谁、在什么时候、说了什么”，只需少量后期处理即可。第三，用户可在转录请求中直接注入特定领域的专业词汇、专有名词或生僻技术术语，大幅提升了垂直领域的识别准确度。第四，VibeVoice ASR原生支持50多种语言，且支持无缝的语种切换（如中英混杂对话），用户无需在调用前手动配置语言。第五，也是最核心的一点：模型巧妙地将声学和语义音频分词器与大语言模型解码器相结合，真正实现了具备长上下文理解能力的语音理解。

真正的技术创新不是功能的简单叠加，而是对根本性问题的重新定义。

“科技观察者”

实测表现

在包括AISHELL-4、AMI和AliMeeting在内的五项权威基准测试中，VibeVoice ASR的性能一致超越了此前领先的闭源多模态大模型。在说话人归属准确性方面，VibeVoice ASR的DER（说话人错误率）降至3.42%，远优于对比模型的16.29%。在综合评估“谁、何时、说了什么”的tcpWER指标上，VibeVoice ASR以14.81%的表现大幅领先，解决了长音频中常见的时间戳偏移问题。

开发者友好

VibeVoice ASR现已完全集成到Hugging Face Transformers生态系统中，并可通过Microsoft Foundry模型目录轻松检索。开发者可以使用自己熟悉的工具，轻松进行实验、评估和部署。这种开放的姿态无疑将加速语音识别技术的普及和应用创新。

如有侵权，请联系删除。

语音识别大模型长音频处理微软结构化输出积墨AI AI智能体 AI智能体平台私有化AI智能体平台企业级AI智能体

Share This Post

通用语音识别模型VibeVoice ASR：60分钟长音频一键转写结构化输出

五大核心能力

性能超越与创新架构

实测表现

开发者友好

Popular Articles

企业级AI智能体如何突破效率孤岛，实现价值共振？

阿里通义Qwen模组：一周三次开源造势

积墨AI 7月更新日志

Related Articles

广州市科技局莅临我院调研交流，聚焦AI智能体政务应用可行性与部署方案

前瞻全球AI发展趋势

AI Agent商业化元年：智能体从概念走进千行百业

前瞻全球AI发展趋势

北京: AI Agent与学习分析赋能高效评价与课堂互动

数字文创赛道如何用AI智能体'搞大钱'？网络视听最高规格大会正在报名

北京: AI Agent与学习分析赋能高效评价与课堂互动

100页 2026年人工智能趋势报告

ROUND TALK · 共创共生，AI智能体圆桌沙龙圆满举办

科协带你玩AI：OpenClaw核心原理解析与架构演进

国家人社部认证！2026 人工智能训练师证书，报考入口与考试安排全指南（2026 生成式人工智能巴黎峰会举行 聚焦 AI 变革与中欧创新合作）

AI+Agent 时代企业管理新范式 ——《龙虾（OpenClaw）管理学》

“算力领航 赋能千百行业”2026第三届AI算力产业大会成功召开

特赞科技x中欧国际工商学院「AI+商业进化论：系统·闭环·智效」论坛成功举办

群核科技开启全球招股；众擎机器人完成2亿美元B轮融资；红熊AI完成2.1亿元A轮融资

聚焦AI+光电，OSIC 2026 70+合作伙伴全阵容邀您共赴苏州

心智对话：AI Agent如何重构中国半导体产业逻辑？

AI融资持续升温：从脑机接口到具身智能，资本正在重写AI产业版图，WHOOP 已经估值过百亿美元

AI革命、芯片战争与价格战：2026年4月科技三线交锋

重大消息：学术AI OpenClaw 辅助科研，简直逆天了，做出重大科研突破！

OpenClaw 与 AI 原生组织：重塑组织形态的技术革命与产业实践

科技产业三重奏：AI资本狂欢、芯片涨价潮与新能源汽车出海加速——2026年4月科技前沿深度报道

百度伐谋Agent 2.0再夺全球第一，中国AI工程化能力再获验证

“周五之约 繁星汇聚”AI Agent产品赋能园区企业

Post-MWC思享汇：Mobile AI十问锚定产业新十年

斯坦福大学孙卿云博士：构建可自我进化的金融AI智能体

中国信通院2026年首批可信AI企业级智能体系列评估正式启动

Post-MWC思享汇：Mobile AI十问锚定产业新十年

来了个大的！中兴一口气将AI底座、终端、生态全端出来了

AI智能体（Agent）开发：创造属于自己的数字生命

中国信通院2026年首批可信AI企业级智能体系列评估正式启动

微信公众平台打击AI自动化创作/SpaceX 2025年营收逾185亿美元，整合xAI后净亏损近50亿美元/阿里巴巴Qwen系列累计下载量突破10亿次

2026年AI趋势报告

亚马逊强推年内2000亿美元AI支出

周五之约 繁星汇聚 AI Agent产品赋能园区企业

OpenClaw 2026.4.5 重磅更新：你的 AI 助手终于会'做梦'了！

晶耀智远刘钢将出席2026人工智能基础设施峰会：OpenClaw开启AI Infra智能体主机新纪元

谷歌Gemma 4全面开源：Apache 2.0协议打破枷锁，手机端离线AI智能体开启新纪元

300 万、AI 校务助理智能体大单

【伦敦】针对一线劳动力管理的AI平台 Sona 完成 4500 万美元 B 轮融资，加速美国扩张与一线运营系统重构

AI北美巨头放大招绞杀，Token经济成为产业核心热点

进入物理世界，硅谷VC Eclipse13亿美元押注实体产业AI初创

【伦敦】针对一线劳动力管理的AI平台 Sona 完成 4500 万美元 B 轮融资

育见AI 启智先锋 数智领航再出发——青岛市第三实验初中2026年智能体赋能教育教学行动正式启动

Xoople获融1.3亿美元，用卫星+AI锁定企业工作流入口

AI Agent赋能培训圆满落幕

【官方邀请函】OpenClaw × Claude Code：引爆AI招聘Agent极速进化

【伦敦】针对一线劳动力管理的AI平台 Sona 完成 4500 万美元 B 轮融资，加速美国扩张与一线运营系统重构

龙虾引爆！医疗Agent狂飙，蚂蚁京东百度争相布局，AI医疗又一重磅风口！

ISC.AI 2026全球议题征集：定义智能体时代，你的声音就是未来

新增AI Agent与OpenClaw！算力产业全景图（2026版）即将发布

AI北美巨头放大招绞杀，Token经济成为产业核心热点

ISC.AI 2026全球议题征集：定义智能体时代，你的声音就是未来

4月14日北京，企业俱乐部X火山引擎AI Agent算力革命闭门私享会报名开启

AI加速下的材料革命：电子电路原辅材料赛道观察（2026年4月）

GEO智领增长，AI Agent重构全域引擎——AI创新营销工作坊圆满举办

OpenClaw开源AI Agent平台快速崛起，折射个人智能代理时代加速到来（2026年）

恒生聚源携手阿里云启动“超级智能体计划”，加码金融AI生态

线上】AI基础设施技术测试周

《AI智能体（Agent）赋能制造管理提效》

Figure AI 实现每90分钟下线一台人形机器人

GEO智领增长，AI Agent重构全域引擎——AI创新营销工作坊圆满举办

影目科技 印传学：AI+AR智能眼镜 从破圈到发展趋势预判

美国EdgeRunner AI公司推出军用版OpenClaw——WarClaw，实现战术边缘智能体决策优势

新加坡AI建筑协作平台OnSite完成170万新元种子轮融资

【投融资】前OpenAI与DeepMind创立，AI科学实验室PeriodicLabs，估值涨5倍至70亿美元

【具身智能】MIT博士团队，45天狂融30亿！冲击中国具身智能估值第一

智能眼镜未来增长点何在？余江AI眼镜产业发展大会给出关键答案

掘金东南亚！2026全球AI+IoT产业生态高峰论坛（新加坡）诚邀共拓蓝海

美国EdgeRunner AI公司推出军用版OpenClaw——WarClaw，实现战术边缘智能体决策优势

国家人社部认证！2026 人工智能训练师证书，报考入口与考试安排全指南（2026 生成式人工智能巴黎峰会举行聚焦 AI 变革与中欧创新合作）

“算力领航赋能千百行业”2026第三届AI算力产业大会成功召开

“周五之约繁星汇聚”AI Agent产品赋能园区企业

周五之约繁星汇聚 AI Agent产品赋能园区企业

育见AI 启智先锋数智领航再出发——青岛市第三实验初中2026年智能体赋能教育教学行动正式启动

影目科技印传学：AI+AR智能眼镜从破圈到发展趋势预判

灵伴科技CEO祝铭明：AI 眼镜重构产业生态余江应以认知更新拥抱智能未来

灵伴科技CEO祝铭明：AI 眼镜重构产业生态余江应以认知更新拥抱智能未来