长上下文为什么消耗大量显存
模型权重加载后相对固定,而KV Cache会随上下文长度、层数、批量和并发请求继续增长。长上下文服务常出现“权重可以装入、请求却无法并发”的情况,缓存管理因此成为推理系统的主要容量问题。
ShadowKV的研究方向
论文利用长上下文KV表示中的结构特征,减少需要保留在GPU高带宽内存中的数据,并设计适合解码阶段访问的缓存与恢复流程。评估同时覆盖缓存容量、GPU数据移动和注意力计算,避免只看压缩率。
阅读实验部分的注意事项
- 上下文长度、模型注意力结构和并发配置都会改变KV Cache规模。
- 稀疏或近似方法必须同时考察任务质量,不能只比较Token吞吐。
- CPU内存和PCIe传输参与后,尾延迟可能比平均延迟更敏感。
- 与PagedAttention等机制比较时,需要核对两侧的批调度和显存利用率设置。
部署参考
准备长文档问答、代码仓库分析或多轮Agent服务时,可用本文建立容量测试:先固定模型和精度,分别增加上下文与并发,记录KV Cache、首Token时间、解码速度和拒绝率。论文数据是方法验证,不是可直接照搬的生产容量表。
署名与处理说明
作者:Hanshi Sun、Li-Wen Chang、Wenlei Bao、Size Zheng、Ningxin Zheng、Xin Liu、Harry Dong、Yuejie Chi、Beidi Chen。本站本地托管未经修改的英文PDF,中文部分为独立阅读导引。原论文按CC BY 4.0许可再分发。
来源:Proceedings of Machine Learning Research (PMLR)。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- EN
- 原文更新时间
- 2025-07-13
- 许可证
- Creative Commons Attribution 4.0 International (CC BY 4.0)
- 文件校验
- bf255242e6b60c67…




