模型变小的重点不只在参数量
DeepSeek-V4.1-Flash是新架构家族中的较小型号,总参数552B,但输入阶段仅激活8B参数、输出阶段激活16B参数。其Causal Encoder–Decoder非对称设计针对预填充和逐Token生成的不同计算特征分配容量,而不是让两阶段使用完全相同的活跃网络。
KV缓存直接影响长上下文服务成本
官方称相较上一代,该模型KV缓存只需要四分之一HBM和八分之一SSD空间。对Agent和长会话而言,缓存可能比权重更早挤满显存;如果服务使用前缀缓存,缓存命中请求的存储与搬运成本还会影响最终报价。V4.1-Flash同时加入原生视觉理解,意味着图片输入也进入Agent执行链路。
上线前需要验证的指标
552B总参数仍对加载、路由和多卡通信提出要求。部署方应分别测量prefill吞吐、decode速度、不同上下文长度的KV占用、缓存命中率及P99延迟。官方基准说明能力上限,但具体业务还需检查中文、代码、工具调用和视觉任务的稳定性,尤其不能把缓存压缩比例直接当成整机成本下降比例。
来源:国内AI厂商与开源生态。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- ZH-CN
- 原文更新时间
- 2026-09-10
- 许可证
- 未登记



