沐曦股份9月18日宣布,MXMACA平台相关适配代码合入LMCache上游主线。合作围绕大模型推理中的KV缓存管理展开,并提出持续集成验证。相比企业独立维护下游分支,上游合入有利于后续版本协同,但具体可用组合仍需核对发布版本。
原消息给出LMCache上游代码合入记录和后续路线图,并表示将建立常态化CI验证。讨论的复用场景包括多轮会话、重复前缀与RAG文档块;缓存可以进入不同存储层,并在请求或推理实例之间管理。这样把KV从仅由单个引擎控制的临时状态,扩展为需要版本、索引和生命周期管理的资源。合入主线是维护方式的变化,具体缓存复用收益仍随业务重复程度与传输路径变化。
什么时候缓存复用真正有价值
重复系统提示词、稳定的知识片段和长会话,可能产生可复用的前缀。若请求完全不同,或者模型、分词器、提示词模板发生变化,原有缓存未必还能命中。缓存系统需要同时管理内容身份、版本与有效期,而不是简单把显存内容写到磁盘。
缓存从GPU移到主机内存、NVMe或网络存储,也引入传输与索引成本。对短请求,读取成本可能抵消节省的计算;对长前缀,高命中率才可能体现优势。评估时应分别测冷请求、热请求和混合负载,不把全部请求预热后的结果当成日常表现。
企业接入还有隔离问题
多租户服务不能让一个客户的缓存被另一个客户误用。缓存键应包含模型版本、模板、必要的租户边界与参数约束;删除知识库后,相关缓存失效机制也需要验证。日志可记录命中次数和字节数,但不应直接保存敏感提示词。
建议先在独立试验实例启用缓存,保留未启用的基线组。比较首字延迟、GPU占用、传输带宽和完成率,随后验证缓存服务不可用时是否能回到普通推理。对运维而言,上游协作最重要的价值是可持续维护,而不是一次演示中的最高加速数字。
来源:沐曦股份官方新闻。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- ZH
- 原文更新时间
- 2026-09-18
- 许可证
- 摘要引用与独立评论



