随着大语言模型(LLM)上下文长度不断增加,推理阶段的内存占用和能源消耗正逐渐成为实际部署中的关键瓶颈。 标准全注意力机制会为每个新 token 保留此前所有 token 的 Key 和 Value,KV Cache 随上下文持续增长,解码成本也随之攀升。 尽管线性注意力方法试图将时间和内存复杂度从 本文链接