菜单
小墨

小墨

Qwen3.8-Flash:全新架构,更强更稳更划算

大语言模型的发展正在进入一个新的效率优化阶段。如何在保持强大能力的同时显著降低训练和推理成本,成为各大模型团队竞相攻克的核心课题。近日,一款全新的多模态MoE大模型正式发布,以125B总参数量、每token仅激活6B参数的架构设计,为行业带来了新的解决思路。

概述

这款模型名为Qwen3.8-Flash,其核心亮点在于围绕四个维度展开的系统性架构升级。

Attention机制:GDN+QSA混合架构

传统的全局注意力机制虽然能让模型直接访问所有历史信息,但随着上下文变长,计算量和键值缓存的访存成本会急剧上升,成为明显的性能瓶颈。新模型采用了Gated DeltaNet(GDN)与Qwen Sparse Attention(QSA)相结合的混合架构:每四个网络层中,三层使用GDN负责将历史信息持续压缩并存储在固定大小的循环状态中,剩余一层保留全局Attention用于精确检索。 QSA进一步优化了稀疏注意力的实现方式——使用轻量级indexer先将序列聚合成micro-block,在block级别上估计上下文重要性,然后选出最相关区域执行Attention计算。这种做法不仅减少了实际计算量,还大幅降低了“寻找重要上下文”本身的索引开销。通俗理解,GDN负责高效“记住”,QSA负责精准“查找”。实测数据显示,面对1M token的超长上下文,QSA在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速,在90%前缀缓存命中率的场景下,Prefill吞吐量达到前代模型的8.6倍。

通过架构层面的创新优化,大模型的效率提升仍有巨大空间。

“技术观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

Gated Residual:多路径信息传递

传统Transformer架构中,所有网络层共享同一条Residual Stream进行信息读写,随着层数加深,早期特征不断与后续信息混合,重要信息容易被稀释。新模型引入的Gated Residual(GR)机制,将Residual Stream扩展为4条并行分支,通过动态门控控制信息读写。 这意味着模型能够根据当前输入内容,动态且精细地决定从各分支读取多少信息、向各分支写入多少信息。其中一条分支自然形成连接第一层Attention和大部分中后层的长距离通道,有效保留早期关键信息。此外,GR对Hyper-Connection进行了简化,事实证明当读写已足够灵活时,额外的分支混合操作收益有限。残差状态还支持FP8存储,进一步降低访存开销。

N-gram Embedding:低成本扩展模型容量

受Per-Layer Embedding和Engram等工作启发,模型引入N-gram Embedding从Transformer参数之外的维度扩展容量。与普通Embedding根据单个token查表不同,N-gram Embedding结合当前token与前几个token组成的局部上下文进行查表,能够为常见短语搭配和局部语言模式提供更丰富精准的额外表示。 新模型额外引入51B的N-gram Embedding参数。由于查询位置可提前确定,这些参数可存放在Host Memory中,通过异步Prefetch与模型计算重叠,无需长期占用GPU显存。这相当于在几乎不增加每token计算量的前提下,增加了一个大规模的“局部模式记忆库”。

如有侵权,请联系删除。

#大模型#多模态#MoE#Qwen#AI
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信