开源内容不只有模型权重
月之暗面于2026年7月27日公开Kimi K3模型权重、技术报告和官方代码资料。与只开放API不同,这次发布允许开发者研究模型结构、下载权重并在符合许可证的条件下进行部署和二次开发。官方同时公开了与训练和推理相关的基础设施项目,使外部团队能够更完整地理解模型如何扩展到超大规模。
根据官方仓库,Kimi K3总参数量为2.8万亿,采用Mixture-of-Experts架构,每个token激活约1040亿参数。模型包含896个专家,每次选择16个专家,并设置共享专家。总参数量代表模型容量,但实际推理成本更接近激活参数量、上下文长度、KV缓存、视觉编码器和并行通信开销的综合结果。
三项关键技术变化
第一是Kimi Delta Attention与Gated MLA组合。模型93层中包含69层KDA和24层Gated MLA,目标是在保持长上下文能力的同时降低注意力计算与缓存压力。
第二是Attention Residuals和Stable LatentMoE。官方称新的稀疏专家组织方式提升了规模化训练效率。对于工程团队而言,真正需要关注的不只是评测分数,而是专家路由、跨卡通信、负载均衡和推理框架是否成熟。
第三是原生多模态。Kimi K3集成MoonViT-V2视觉编码器,可处理文本与图像输入,并面向软件工程、知识工作、长周期智能体任务和多模态理解进行优化。它支持1048576 token上下文,但百万上下文并不意味着所有请求都应使用最大长度;上下文越长,首token延迟、显存占用和服务成本通常越高。
为什么2.8T不等于普通服务器可以部署
即便采用MoE,完整权重仍然非常庞大。官方模型使用MXFP4权重和MXFP8激活的量化感知训练方案,能够降低存储和计算压力,但生产部署仍需要多卡或多节点系统、充足的主机内存、高速互连和适配的推理引擎。
官方推荐的推理生态包括vLLM、SGLang和TokenSpeed。部署团队应重点核对:推理框架是否支持KDA与模型自定义代码;GPU架构是否支持相应低精度格式;单机能否容纳模型分片;跨节点通信带宽;百万上下文下KV缓存的实际容量;并发量和延迟目标。
因此,Kimi K3更适合云端集群、研究机构和拥有大规模GPU资源的企业。普通工作站更现实的方式是调用官方API、使用托管推理服务,或者等待社区提供经过验证的蒸馏和更小规模版本。
对国内开源生态的意义
Kimi K3把竞争从“开放聊天模型”推进到开放超大规模多模态智能体模型。开发者不仅能比较模型能力,还能研究长上下文、MoE路由、低精度训练和智能体工程。配套基础设施的开放,也有利于国产GPU和推理框架团队开展适配。
但开源权重不等于没有使用条件。官方采用Kimi K3 License,对模型服务业务和超大规模商业产品设置了额外条款。企业在部署、再分发或提供模型服务前,应核对许可证原文,不应只根据“开源”两个字判断商业使用范围。
信息来源
本文根据月之暗面官方Kimi K3仓库、模型卡、技术报告和许可证进行二次整理,参数与部署要求以官方后续版本为准。
- 官方GitHub:https://github.com/MoonshotAI/Kimi-K3
- 官方Hugging Face:https://huggingface.co/collections/moonshotai/kimi-k3
- 技术报告:https://arxiv.org/abs/2607.24653
本文没有把官方评测榜单作为绝对结论。不同模型的测试工具、推理预算和运行环境不同,选型时仍需使用自己的任务集进行验证。
来源:网昱原创。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- ZH-CN
- 原文更新时间
- 未提供
- 许可证
- 未登记




