中科曙光9月11日介绍scaleFabric Token加速技术体系,以无损RDMA网络连接计算与存储。官方称GPU主动发起通信的IBGDA技术已在十万卡级集群验证,并完成DeepEP等通信框架适配。对采用混合专家架构的大模型而言,这类进展关系到GPU之间每次交换数据需要等待多久。
同样的网速,模型速度可能不同
网络规格常以Gb/s表示,它描述可传输的数据量。实际模型除了传大块张量,还可能频繁交换较小消息。消息发起、排队、同步与完成确认都需要时间;当每轮计算很短时,这些延迟占比会变大,即使带宽尚未满载,GPU也可能等待数据。
MoE会把Token送往不同专家,再将结果聚合回来。专家位于不同GPU甚至不同服务器时,路由不均衡、通信拥塞和同步尾部延迟会影响整轮执行。购买更快网卡有帮助,但软件能否高效发起通信,以及数据是否走合适路径,同样决定最终效果。

GDR与IBGDA解决的环节不同
按照曙光的技术说明,GDR允许网卡直接访问GPU显存,减少经CPU内存中转;IBGDA进一步让GPU驱动网卡和管理传输,减少关键路径上的CPU调度参与。前者着重数据通路,后者还涉及通信发起方式,两者不能简单视为同一功能。
部署时需要确认GPU、网卡、驱动、IOMMU与PCIe拓扑的兼容关系。GPU和网卡跨CPU插槽连接,或PCIe路径共享带宽,可能产生新的限制。运维团队应保留节点拓扑、固件版本和集合通信配置,便于解释同型号服务器间的性能差异。
纳秒级网络指标怎样映射到业务
官方公布单跳转发延迟低至260纳秒、特定测试端到端延迟低于1微秒。这些是网络层的厂商测试值,不能换算成所有用户请求的响应时间。模型服务还包括排队、预填充、生成、缓存访问与应用处理,端到端收益取决于通信原本占用了多少时间。
建议先做AllReduce、AllToAll和不同消息尺寸的基准,再跑目标模型。记录通信占比、链路利用率、专家负载分布、P99请求延迟与实际Token吞吐。只有模型级数据也改善,网络优化才转化为可感知的服务能力。
扩容时应保留哪些证据
先用小规模节点复现,再按计划拓扑扩大测试,加入多作业竞争和节点故障。检查拥塞控制、重传、告警与故障定位是否可用,并核对DeepEP适配对应的版本。十万卡验证代表厂商完成了大规模工程测试,企业自己的网络层级与负载仍需单独验收。
来源:中科曙光官方新闻。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- ZH-CN
- 原文更新时间
- 2026-09-11
- 许可证
- 未登记



