中科曙光在8月28日数博会期间发布ParaCache,通过分层保存和跨节点复用推理中间结果,减少长文本、多轮会话中的重复预填充。官方介绍的存储层次包括GPU显存、CPU内存、SSD和分布式存储,底层结合ParaStor与FlashNexus。

长对话为什么会反复处理历史

大模型生成新Token时需要参考前面的内容,服务会保留对应KV状态。若请求被重新路由、缓存被淘汰,或者应用每次把完整历史当作新请求提交,系统可能再次处理已计算过的前缀。长系统提示词、同一份知识资料和不断增长的Agent轨迹,都会放大这部分开销。

缓存复用要求前缀在Token层面满足规则。肉眼看来一样的文本,如果模板、空格、工具描述或序列化顺序改变,也可能影响命中。应用侧稳定提示词结构,与服务端优化一样重要;随意移动动态字段,可能让整段本可复用的内容失效。

分层缓存是在交换两种成本

显存快且昂贵,CPU内存容量较大,SSD与共享存储能保存更多历史。将不常使用的缓存迁出显存,可以给活跃请求腾出空间,但重新加载需要耗时。缓存策略要比较“重新计算需要多久”与“读取并恢复需要多久”,而非把所有缓存长期保留。

热点频率、缓存块大小、网络带宽和驱逐策略共同影响效果。如果存储读写队列拥堵,大量回迁也可能拖慢服务。因此监控应包含每层命中率、回迁字节数、读写尾延迟、淘汰次数及GPU等待时间。

对公开加速比例的正确读法

曙光称约12万词元输入的测试中,首Token等待最高降低98.5%,高并发词元处理量最高达到原来的27倍。公告另举实际在线业务平均等待降低50%以上的案例。前者是特定基准峰值,后者也有具体业务背景,均不能直接推定新项目的平均收益。

高命中请求的预填充节省更明显;第一次输入的新内容仍需计算。评估应把冷、热请求分开,按真实比例混合压测,并同时看总请求成功率。只展示热缓存结果,会高估用户刚打开文档或首次进入会话时的体验。

如何判断企业是否值得部署

可先抽取脱敏后的请求,统计共享系统提示、资料前缀和连续会话的比例,再用固定硬件做开启与关闭缓存的对照。比较P95首Token时间、输出速度、每小时成功请求量和总资源成本。若收益主要来自少数超长重复请求,可只为这类业务启用专门缓存池。

上线还需设计缓存版本、租户权限和删除策略。模型权重或推理精度升级后,旧缓存通常需要重新验证或失效;故障时要能重新计算。这样才能把缓存优化变成可持续运行的服务能力。

来源、翻译与版权说明

来源:中科曙光官方新闻。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
ZH-CN
原文更新时间
2026-08-28
许可证
未登记