菜单
积墨AI

积墨AI

会议ASR的范式跃迁:从模块化Pipeline到端到端大模型

真实会议从不配合理想假设。有人紧邻麦克风,有人坐在房间另一头;有人高声阔论,有人低声补充;键盘声、空调声、笑声随时插入;讨论中混杂英文缩写、项目代号和专业术语。传统会议转写系统依赖“分段-降噪-分割-识别”的长流水线,每个环节都在向下一个环节传递误差。当两个人同时开口说话,系统可能把人名和内容揉成一团;当项目名被听错,后续摘要、行动项提取和知识沉淀全盘皆错。问题在于:我们能否不再依赖越来越复杂的外部前端,而是让大模型自己学会听懂混乱但有结构的会议现场?

流水线的尽头是更多的模块?

过去二十年,会议ASR系统普遍采用模块化架构:先做语音活动检测(VAD),再分段,再做说话人分割与识别(Diarization),最后送入ASR引擎。每一步都有明确分工,工程上可维护,但代价同样清晰——误差逐级传播。一个技术决策会议中,如果“Qwen-Audio-3.0-ASR”和“Claude Code”被切到不同说话人名下,或者被识别成近似发音词,后处理系统几乎无法纠正。更深层的问题在于,这种架构假设“清晰单说话人音频”是默认状态,而真实会议恰恰是这个假设的反面。当场景切换到远场、强混响、多语言混合时,流水线中的每个模块都可能需要重新调参甚至重写,通用性大打折扣。

让能力长在模型内部

大模型路线提供的不是局部优化,而是架构范式的迁移。Speech Foundation Model通过大规模预训练,在海量带噪、带混响、带重叠的音频数据中习得“内生”能力:无需外部VAD即可判断何时有人说话;无需独立Diarization模块即可输出speaker change;遇到专业术语时能利用长上下文保持一致性。更关键的是“克制”——当声学信息不足以支撑高置信识别时,模型不会像生成式语言模型那样“补”一段流畅但不存在的内容。这种能力不是简单把模型参数堆大就能获得的,而是需要训练数据本身就覆盖足够多的真实会议场景、足够丰富的声学变化。

会议转写的成败,不在干净音频里、不在模块化Pipeline里,而在模型见过的每一段真实坏音频里。

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

四项核心能力与三个研究方向

从产业实践经验看,会议ASR大模型必须同时具备四项能力:声学鲁棒性,即在距离、混响、噪声和设备失真下保持识别稳定;多说话人结构理解,能处理turn-taking、插话、抢话和重叠片段;长上下文建模,让术语缩写在整场会议中保持一致;克制生成,不在低置信区域自由发挥。当前研究前沿聚焦三个方向:Serialized Output Training让模型学习多说话人顺序输出,显式建模speaker change;说话人条件注入如DiCoW、SE-DiCoW将目标说话人信息作为条件传入模型;TagSpeech等统一生成框架同时输出文本、说话人和时间戳。这三条路径共同指向同一个目标:让模型直接输出“谁在什么时候说了什么”,而非等待后处理去猜测归属。

从一段文字到可追溯的结构化记录

输出格式的升级同样关键。传统ASR输出一整段无归属纯文本,会议智能体无法区分谁说了哪句话,更无法追溯关键决策的责任人。面向下一代会议智能体,ASR大模型的输出必须包含说话人标签、时间戳和重叠片段标注。例如当会议中讨论“overlap case”时,系统应明确输出[00:03:21.4] Speaker A说了什么、[00:03:23.0] Speaker B在何时插入。这种结构化输出才是会议摘要、行动项提取、待办追踪和知识库沉淀的可靠输入。上层智能体无论做总结还是问答,都依赖底层ASR提供第一层事实——关键术语听错一句话,结论就可能偏离整场会议的核心议题。

会议ASR的下一站,不是追求更低的标准测试WER,而是在真实会议室中让模型成为“训练充分的听写员”。它不需要用户懂前端参数,不需要会议室足够安静,只需要直接从原始录音中提取内容、说话人和时间结构。当大模型能够内生地处理远场、混响、重叠、术语和长上下文,会议智能体才算真正拥有了可靠的语音入口。

#ASR大模型#多说话人识别#Speech Foundation Model#Serialized Output Training#长音频理解#声学鲁棒性
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信