PyramidKV:基于金字塔式信息汇聚的动态 KV 缓存压缩

← 全部研究

KV 缓存压缩与长上下文推理

COLM 2025 · Spotlight · PDF · 项目主页 · 代码

把缓存留给信息仍然分散的层。 PyramidKV 观察到,注意力模式随深度变化:底层广泛读取上下文,高层则集中到少数关键 token。方法在保持总预算不变的前提下,为底层分配更多 KV 缓存,为高层分配更少缓存;每个头再根据最近指令窗口的注意力,选择要保留的 token。整个过程无需训练模型。

完整缓存、固定位置缓存、均匀预算缓存与 PyramidKV:底层分配更大的缓存。
论文图 1:PyramidKV 随注意力在深层逐渐集中,重新分配固定的跨层缓存预算。 点击图片可放大。

论文在 Llama-3-8B/70B-Instruct 和 Mistral-7B-Instruct 上评测了 LongBench 的 17 个数据集及大海捞针检索。在 2,048-token 缓存预算下,Llama-3-8B-Instruct 的 LongBench 平均分为 41.49,完整缓存为 41.46。将预算压缩到 64 token 时,TREC 准确率为 58.00,SnapKV 为 38.50。这些结果表明,跨层分配缓存能在压缩时保留质量,并在紧预算下带来收益;实际保留的性能取决于模型、任务与缓存大小。