事件概况
2026世界人工智能大会期间,曙光8000全国产10万卡人工智能超集群投入使用,并被列入大会展示成果。公开信息显示,该系统面向科学计算与人工智能复合任务,覆盖从FP64高精度计算到INT8智能计算的多种精度需求。
10万卡意味着国产算力基础设施从单机和千卡集群验证,进一步走向超大规模系统工程。芯片数量只是起点,真正困难的是让计算、网络、存储、调度和故障恢复形成可持续运行的整体。
为什么超大集群不只是“堆卡”
卡数扩大后,通信拓扑会直接影响训练效率。数据并行需要高效梯度同步,张量并行和流水线并行需要更低时延的卡间与节点间通信。任何网络拥塞、链路抖动或拓扑不合理,都可能让大量加速卡处于等待状态。
存储同样是关键瓶颈。大模型训练需要持续读取数据集、写入检查点并保存日志。分布式存储必须同时满足吞吐、元数据性能、并发访问和容错要求。公开资料提到的高速互连与分布式存储能力,正是判断超大集群能否有效运行的重要部分。
国产化的工程含义
全国产并不只涉及计算芯片,还包括服务器、网络、存储、系统软件、驱动、编译器、通信库和集群管理平台。上层框架能否稳定支持主流模型,故障定位工具是否完善,任务迁移成本是否可控,都会决定用户是否愿意长期使用。
对普通项目方的参考
大多数企业不需要直接使用10万卡规模,但可以借鉴其验收方法:用真实模型测试有效吞吐;记录多机扩展效率;进行节点故障和任务恢复演练;持续监控存储、网络和功耗;核算单位有效训练量的综合成本。
规模新闻值得关注,但项目采购最终仍应回到可复现基准、稳定交付和软件兼容性。
信息来源
本文根据数字中国建设峰会发布的《首个全国产10万卡人工智能超集群正式投用》及公开技术信息二次整理。
- 官方信息:https://www.digitalchina.gov.cn/2026/xwzx/szkx/202607/t20260727_5350810.htm
来源:网昱原创。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- 中文
- 原文更新时间
- 未提供
- 许可证
- 未登记



