KV-Cache到底在缓存什么:大模型推理的物理基础

2026年7月22日

71

604

KV-Cache到底在缓存什么:大模型推理的物理基础

在大模型推理优化领域,KV-Cache是一个经常被提及却又常被误解的概念。许多人将其视为某家厂商的独家优化技巧,但实际上,KV-Cache是Transformer架构本身决定的物理存在,是推理过程中不可避免的副产品。理解KV-Cache的本质,对于把握大模型推理的核心瓶颈至关重要。

概述

Transformer的自注意力机制要求每个token在每一层都会进行三次线性投影,得到Query、Key、Value三个向量。当生成新token时,需要用新token的Q去和所有历史token的K做点积运算,通过softmax得到注意力权重,再加权所有历史token的V。

为什么必须缓存

关键问题在于:如果每生成一个token都重新计算所有历史token的K和V,计算复杂度将达到O(n²),在长上下文场景下根本无法运行。因此,推理时必须将历史token的K和V缓存下来。新token进来只需计算它自己的Q/K/V,然后用Q去匹配缓存中的所有K,加权缓存中的所有V。这个缓存机制将复杂度从O(n²)降低到O(n),是推理效率的关键保障。

KV-Cache不是某个厂商的优化技巧,是Transformer架构本身决定的物理存在。

“技术观察”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

KV-Cache的显存账

KV-Cache的显存占用公式可以表示为:2 × n_layers × n_kv_heads × d_head × seq_len × bytes_per_param。以Llama 3 70B为例,在GQA配置下(8个KV head,80层,每head 128维,FP16),8K上下文需要约2.5GB显存,32K上下文需要10GB,而128K上下文则需要40GB。这相当于模型权重(140GB)的28%。更极端的例子是GPT-3,在128K上下文下KV-Cache显存占用高达460GB,远超模型权重本身。

优化路径:压缩体积

随着context长度增加,KV-Cache占总显存的比重持续攀升。8K时仅占2%,128K时占23%,而1M上下文下甚至能超过50%。这解释了为什么在长上下文时代,KV-Cache优化从“锦上添花”变成了“能否运行”的关键问题。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI