集群运维与排障AMD ROCmAMD ROCm PyTorch容器部署:兼容矩阵、设备映射、算子验证与性能排查
使用AMD验证的ROCm PyTorch容器建立GPU环境,解释/dev/kfd、/dev/dri、HIP版本、设备权限和多卡验证,并避免把CUDA教程直接套到AMD平台。
集群运维与排障AMD ROCm使用AMD验证的ROCm PyTorch容器建立GPU环境,解释/dev/kfd、/dev/dri、HIP版本、设备权限和多卡验证,并避免把CUDA教程直接套到AMD平台。
集群运维与排障Kubernetes GPU从GPU节点驱动和设备插件开始,让Kubernetes上报nvidia.com/gpu或amd.com/gpu,编写最小测试Pod,并根据事件定位资源为零、Pod Pending和异构卡误调度。
集群运维与排障DCGM Exporter在每个GPU节点部署DCGM Exporter,通过9400端口输出Prometheus指标,解释温度、功耗、显存、PCIe、Xid和健康指标,并设计避免告警噪声的规则。
集群运维与排障PyTorch从宿主机驱动到PyTorch张量、混合精度和多GPU通信逐层验收,解释nvidia-smi、nvcc与torch.version.cuda为何可能显示不同版本。
集群运维与排障NVIDIA Container Toolkit面向Ubuntu GPU服务器,从驱动检查、官方软件源、Docker运行时配置到CUDA容器验收,解释宿主机CUDA与容器CUDA的关系,并给出常见故障定位顺序。
集群运维与排障NCCL按单卡、点对点、单机集合通信和多机网络四层排查NCCL初始化卡死与性能异常,包含拓扑读取、共享内存、网卡选择、日志采集和nccl-tests基线。
集群运维与排障AI算力
集群运维与排障AI算力把新到货GPU服务器整理成可审计、可回滚、可交接的基础运行环境,给出准备、实施、排错和验收方法。
集群运维与排障AI算力
集群运维与排障AI算力
集群运维与排障AI算力在GPU掉卡、任务崩溃或节点异常时形成统一的XID故障响应流程,给出准备、实施、排错和验收方法。
集群运维与排障AI算力
集群运维与排障AI算力
集群运维与排障AI算力解决nvidia-smi正常但容器看不到GPU、CUDA版本不匹配和框架启动失败,给出准备、实施、排错和验收方法。