文档定位
Kimi K3官方技术报告用于说明模型架构、训练方法、评测口径和工程实现。阅读时应把“模型能力结论”与“部署参数”分开:前者用于判断任务潜力,后者决定现有硬件和推理框架能否实际运行。
模型结构索引
官方信息给出的总参数量为2.8T,激活参数约104B。模型采用MoE结构,共896个专家,每个token选择16个专家,并配置共享专家。模型包含93层,其中69层使用Kimi Delta Attention,24层使用Gated MLA。
上下文长度为1048576 token,视觉编码器为MoonViT-V2。百万上下文是能力上限,不是建议的默认请求长度。实际部署需要结合KV缓存、并发量和延迟目标确定最大上下文。
低精度与显存
官方采用MXFP4权重与MXFP8激活的量化感知训练。估算显存时不能只用总参数乘以4bit,因为还需要考虑量化元数据、未量化层、运行时缓冲区、专家分片、视觉编码器和KV缓存。
104B激活参数也不表示单次推理只需装载104B参数。MoE部署通常仍需要保存完整或分片后的专家权重,并在设备之间完成专家路由和通信。
推理框架
官方仓库列出的推荐引擎包括vLLM、SGLang和TokenSpeed。部署前应确认所用版本是否支持Kimi K3自定义模型代码、KDA算子、MXFP格式、多模态输入和分布式专家并行。
如果框架只能加载权重但不能使用优化算子,服务可能可以启动,却无法达到合理吞吐。验证时应记录框架提交版本、GPU型号、驱动、CUDA、通信库和启动参数。
接口注意事项
Kimi K3保持思考历史。多轮调用和工具调用时,应按官方说明保留并传回完整assistant消息,包括reasoning_content和tool_calls,不能只保留content。否则多轮状态和工具链可能出现偏差。
许可证
模型使用Kimi K3 License。一般研究和部署具有较大自由度,但模型服务业务、超大规模商业产品和品牌展示存在额外条件。企业上线前应阅读许可证原文并由法务确认适用条款。
原始资料
- 官方仓库:https://github.com/MoonshotAI/Kimi-K3
- 官方模型集合:https://huggingface.co/collections/moonshotai/kimi-k3
- 技术报告:https://arxiv.org/abs/2607.24653
- 许可证:https://github.com/MoonshotAI/Kimi-K3/blob/main/LICENSE
本文是中文阅读索引,不替代官方技术报告。模型版本和部署方式变化时,应以官方仓库最新提交为准。
来源:网昱原创。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- 中文
- 原文更新时间
- 未提供
- 许可证
- 未登记

