菜单
积墨AI

积墨AI

阿里开源语音增强双星:FLASepformer与JAEC突破长语音处理瓶颈

语音交互和语音通信依赖清晰、可分辨的输入信号。真实环境中的风扇声、道路噪音、键盘敲击声会掩盖语音,扬声器回放进入麦克风会形成回声,多人同时讲话则会造成语音混叠。降噪、声学回声消除(AEC)和语音分离分别处理这三类问题,直接影响语音识别、唤醒与对话、会议通话以及语音克隆的稳定性。语音增强技术还在语音大模型的数据工程中发挥作用——原始音视频在进入转写、切分、说话人标注和语音-文本对齐之前,需要先完成质量检测与增强,以减少低质量数据向训练环节的传递。

三大语音挑战与完整增强链路

现实声音问题对应相应的处理能力:背景噪声需要语音降噪(DNS),直接影响识别、唤醒、对话和语音克隆参考音频;扬声器回声需要回声消除(AEC),影响双讲通信、会议拾音和远端听感;多人重叠说话需要语音分离(BSS),影响说话人标注、会议转写和训练样本构建。FLASepformer是阿里Qwen Audio团队开源的高效语音分离模型,专为长语音序列优化。该模型输入为一段包含两位说话人的8kHz单声道混合语音,输出为两路独立的说话人语音,能够精准处理鸡尾酒会等复杂场景下的语音重叠问题。

门控聚焦线性注意力:效率跃升的核心

FLASepformer的核心机制是门控聚焦线性注意力(Gated Focused Linear Attention,FLA),将传统Transformer注意力的计算复杂度从O(N²)降低到O(N),从而在处理长音频时显著降低计算和内存开销。基于该机制,衍生出FLA-SepReformer与FLA-TFLocoformer两种核心架构,分别用于处理复杂的时域或时频域重叠语音。在RTX A800配合30秒混合音频的测试下,FLA-SepReformer的T/B/L型号推理速度分别达到对应SepReformer基线的2.29倍、1.91倍和1.49倍,GPU显存占用则分别降低至15.8%、20.9%和31.9%,同时保持极具竞争力的语音分离性能。

AI的成败,不在参数规模里、不在论文数量里,而在解决真实场景痛点的每一个技术突破里

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

JAEC可解释架构:工程调试的新思路

JAEC是阿里推出的可解释型端到端AEC模型,时延估计和线性处理均由神经网络实现。TDE网络负责估算远端参考与麦克风信号的相对时延并完成对齐,LP网络则估算线性回声并抵消。透明的处理过程让工程师能够直接观察时延估计和线性处理的结果,便于通信链路的调试和问题排查。JAEC的16kHz版本每次处理160个采样点(约10ms),固定算法延迟352个采样点(约22ms),输出TDE加LP前端结果。区别于传统黑盒AEC方案,这种可解释的设计大幅降低了工程调试的复杂度,也为未来进一步优化非线性处理NLP网络奠定了基础。

场景化组合方案与开源生态

语音增强需要根据具体场景组合不同模型。语音助手与识别场景可采用ZipEnhancer、FRCRN或DFSMN等降噪模型来降低噪声引起的漏识别和错识别问题;实时通话与会议场景建议用JAEC配合DFSMN ANS进行回声消除和降噪,以改善双讲效果和远端听感;多人会议与访谈场景适合用FLASepformer配合VAD或ASR来分离重叠说话人,生成可转写和标注的独立语音流。开源模型支持流式处理和ONNX导出,可与ClearerVoice-Studio等开源语音处理平台衔接,配合fun-denoise等Skill能够快速接入录音清洗、ASR前处理、会议录音优化等业务流程。完整的语音增强工具链为开发者提供了灵活的解决方案。

FLASepformer和JAEC代表了语音增强领域的两个重要方向:前者通过门控聚焦线性注意力突破长语音处理的效率瓶颈,后者以可解释架构革新回声消除的工程实践。这两个开源模型为语音助手、会议系统、智能客服和语音克隆等场景提供了实用的技术工具,也为语音AI从能听到听清、从听清到听懂的发展路径奠定了基础。

#语音分离#FLASepformer#JAEC#回声消除#门控聚焦线性注意力#ASR
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信