菜单
积墨AI

积墨AI

Transformer新增Forecast投影:解码提速1.7倍,长推理准确率再涨6.5分

当大模型上下文突破十万token量级,推理效率的瓶颈正悄然转移——不再是算力够不够,而是数据能否及时出现在算力面前。近日NVIDIA联合MIT等机构发布SparDA论文,为Transformer架构新增一个名为Forecast的投影层,让稀疏注意力在长上下文场景下实现解码提速1.7倍,同时长推理准确率提升6.5个点,而参数量仅增加不到0.5%。这项技术直击当前AI推理过程中GPU空转等待数据的核心痛点,或将成为下一代推理优化的重要方向。

稀疏注意力的两道坎

现代大模型处理超长上下文时,稀疏注意力虽能大幅削减计算量和带宽,但两个顽疾始终未解。首先是搬数据延迟无法被掩盖——每层必须等Query算完才能决定该取哪些KV块,等选定后再去CPU读取,GPU只能干等。其次是选择本身成为新瓶颈——需要用每个Query头对所有候选块打分做softmax,复杂度随上下文线性增长。根源在于选择逻辑被绑定在当前层Query上,Query未就绪就无法预判下一层需求。

Forecast投影的解耦之道

SparDA的核心改动极其克制——每层不再只产出Q、K、V,而是额外产出一个Forecast投影。当前层Forecast负责预测下一层会需要哪些KV块,下一层直接对这些预选块做稀疏注意力。这层提前量带来两个直接收益:运行时可在当前层计算时,通过独立CUDA Stream把下一层所需块从CPU预取到GPU,计算与数据搬运完全重叠,GPU不再空转;Forecast在GQA分组中每组只需一个头,彻底省掉按头打分softmax开销。参数代价极低,8B模型仅多约3300万参数(0.41%),训练时冻结原模型,仅用KL散度让Forecast逼近原稀疏选择器分布。

大模型推理的瓶颈,不在算力里,不在显存里,而在KV块能否提前到达GPU的每一个瞬间里

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

轻量前瞻的产业落地价值

从产业实践看,这种解耦+预取的轻量方案极具落地价值。Agent需要长程记忆、超长上下文,推理瓶颈正从算力转向数据供给效率。Forecast不需要发明新注意力公式,不引入复杂门控或压缩,只是把选择从关键路径挪开。0.4%参数增加就能同时提速又提准,对已稀疏预训练的模型适配成本极低。更重要的是,它指向一个核心洞察:很多系统瓶颈藏在架构的隐性耦合里,而非硬件本身。

实验验证与未来演进

论文在MiniCPM4.1-8B和NOSA-8B两个稀疏预训练模型上验证,NOSA-8B在长推理任务上直接涨6.5分。Prefill最高1.25倍加速,Decode最高1.7倍加速,Decode吞吐量最高比不offload的稀疏方案高5.3倍。核心结论:稀疏注意力不必在效率和质量间二选一,关键在于能否准确预测下一层需要什么数据。这种机制让KV块提前到达GPU,消除硬件等待的每一刻。

未来若将Forecast预测范围从单层扩展到多层,或与动态稀疏、量化等技术叠加,长上下文服务的性价比还会再上一层。SparDA证明:推理优化的下一个突破口,可能就藏在架构解耦的那一层提前量里。

#Transformer#稀疏注意力#KV缓存#CUDA Stream#长上下文
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信