模型变小的重点不只在参数量

DeepSeek-V4.1-Flash是新架构家族中的较小型号,总参数552B,但输入阶段仅激活8B参数、输出阶段激活16B参数。其Causal Encoder–Decoder非对称设计针对预填充和逐Token生成的不同计算特征分配容量,而不是让两阶段使用完全相同的活跃网络。

KV缓存直接影响长上下文服务成本

官方称相较上一代,该模型KV缓存只需要四分之一HBM和八分之一SSD空间。对Agent和长会话而言,缓存可能比权重更早挤满显存;如果服务使用前缀缓存,缓存命中请求的存储与搬运成本还会影响最终报价。V4.1-Flash同时加入原生视觉理解,意味着图片输入也进入Agent执行链路。

上线前需要验证的指标

552B总参数仍对加载、路由和多卡通信提出要求。部署方应分别测量prefill吞吐、decode速度、不同上下文长度的KV占用、缓存命中率及P99延迟。官方基准说明能力上限,但具体业务还需检查中文、代码、工具调用和视觉任务的稳定性,尤其不能把缓存压缩比例直接当成整机成本下降比例。

来源、翻译与版权说明

来源:国内AI厂商与开源生态。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
ZH-CN
原文更新时间
2026-09-10
许可证
未登记