长上下文为什么消耗大量显存

模型权重加载后相对固定,而KV Cache会随上下文长度、层数、批量和并发请求继续增长。长上下文服务常出现“权重可以装入、请求却无法并发”的情况,缓存管理因此成为推理系统的主要容量问题。

ShadowKV的研究方向

论文利用长上下文KV表示中的结构特征,减少需要保留在GPU高带宽内存中的数据,并设计适合解码阶段访问的缓存与恢复流程。评估同时覆盖缓存容量、GPU数据移动和注意力计算,避免只看压缩率。

阅读实验部分的注意事项

  • 上下文长度、模型注意力结构和并发配置都会改变KV Cache规模。
  • 稀疏或近似方法必须同时考察任务质量,不能只比较Token吞吐。
  • CPU内存和PCIe传输参与后,尾延迟可能比平均延迟更敏感。
  • 与PagedAttention等机制比较时,需要核对两侧的批调度和显存利用率设置。

部署参考

准备长文档问答、代码仓库分析或多轮Agent服务时,可用本文建立容量测试:先固定模型和精度,分别增加上下文与并发,记录KV Cache、首Token时间、解码速度和拒绝率。论文数据是方法验证,不是可直接照搬的生产容量表。

署名与处理说明

作者:Hanshi Sun、Li-Wen Chang、Wenlei Bao、Size Zheng、Ningxin Zheng、Xin Liu、Harry Dong、Yuejie Chi、Beidi Chen。本站本地托管未经修改的英文PDF,中文部分为独立阅读导引。原论文按CC BY 4.0许可再分发。

来源、翻译与版权说明

来源:Proceedings of Machine Learning Research (PMLR)。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
EN
原文更新时间
2025-07-13
许可证
Creative Commons Attribution 4.0 International (CC BY 4.0)
文件校验
bf255242e6b60c67