开源模型进入3T级规模
Kimi K3总参数2.8万亿,具备原生视觉能力和100万Token上下文。模型使用Kimi Delta Attention与Attention Residuals,并在896个专家中每次有效激活16个。超高稀疏度降低单Token计算量,但专家路由、负载均衡和跨卡通信会成为主要工程问题。
为什么官方建议64卡以上超节点
模型采用MXFP4权重和MXFP8激活进行量化感知训练。即使低位权重降低容量,总模型仍非常庞大;高带宽通信域能够减少专家并行时的数据交换开销。官方明确建议使用64张或更多加速卡的超节点配置,并为KDA前缀缓存向vLLM社区贡献实现。
不应只看模型榜单
K3展示了GPU内核优化、编译器开发、芯片设计和长程科研等Agent案例,但官方也列出对思考历史敏感、可能过度主动等限制。部署时应验证Agent框架能否完整回传历史,并用权限、审批和沙箱限制高风险动作。算力评估需要结合专家并行效率、缓存命中、输出长度和实际并发,而不是用激活参数简单估算服务器数量。
来源:国内AI厂商与开源生态。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- ZH-CN
- 原文更新时间
- 2026-07-16
- 许可证
- 未登记




