中科曙光9月21日公布升级后的FN Neo,将推理中间数据纳入集中式共享存储池。官方资料列出SAN、NAS与KV三类接口,以及vLLM、LMCache、Mooncake等接入方向。这使存储系统的角色进一步延伸:除了装载模型和数据集,还要帮助不同计算节点复用已经生成的KV缓存。
本地盘很快,为什么还需要共享池
单台服务器的NVMe能提供低延迟读写,但它保存的缓存通常与节点绑定。一个会话被调度到另一台服务器后,如果没有缓存传输和索引机制,新的节点仍需重新计算相同前缀。服务器越多,热点内容的重复保存和重复计算就越明显。
共享池提供跨节点可访问的存储空间,不过“可以读取”还不等于“可以复用”。推理框架必须识别缓存对应的模型版本、Token序列、位置编码、精度和缓存布局,确保读取后与重新计算的结果兼容。网络、存储客户端与GPU运行时也需要衔接,才能避免多次内存拷贝抵消收益。

公开性能数据需要怎样理解
曙光公布单阵列带宽可达160GB/s,并称其测试中的首Token响应时间缩减73%、Token吞吐提升150%。这些是厂商测试结果;公告未完整披露所有模型、硬件数量、输入输出长度与缓存命中条件,不能直接作为不同项目的性能承诺。
总带宽由多路请求共享,单个节点得到的速度还受网卡、交换机和客户端限制。采购比较时,应同时记录缓存读取带宽、GPU等待比例、请求排队时间与端到端首Token延迟。仅用存储压测的顺序读取峰值,难以描述真实推理业务。
哪些负载更容易获得收益
编辑分析认为,使用固定企业手册的客服、反复分析同一代码仓库的Agent、连续多轮长文档会话,是值得优先试验的场景。它们有较多重复前缀。相反,每次输入完全不同且很短的请求,重复计算本来就少,额外缓存检索可能增加复杂度。
验收可采用三组请求:首次冷请求、相同前缀的热请求、跨节点迁移后的请求。固定模型、并发和输入长度,分别测P50/P95首Token时间、输出Token速度、命中率与存储容量。再增加节点或存储故障,检查缓存不可用时是否能退回重新计算。
缓存也属于业务数据
KV缓存来自用户输入,不能当成无敏感信息的临时文件。企业需要租户隔离、访问权限、失效策略和删除流程;模型升级后还应清理不兼容缓存。只有把收益、隔离和故障退路一起验证,共享存储才可能帮助集群提高有效产出。
来源:中科曙光官方新闻。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- ZH-CN
- 原文更新时间
- 2026-09-21
- 许可证
- 未登记



