技术分享
大模型 KV Cache
1 min read181 wordsupdated August 3, 2025
KV-Cache
KV-Cache是目前Transformer常用的功能,应用于Decoder架构的推理加速。
Self-Attention 不带KV-Cache流程
以下流程来自知乎看图学[1]
对于一段文字输入,有以下计算过程:
- 首先输入一个token的embedding,大小为[1, emb_size]

经过公式计算得出attention向量,这里为方便表示被省略
- 输入第二个token

在这里可以发现,attention的计算公式为:
因此可以发现:
随后的attention也同理可得
因此可以得出结论:
- 当前计算方式存在大量冗余,计算量可以优化
- Attention只与相关
- 推理第i个字符只需要i-1即可
推理加速示意图
