集群运维与排障AMD ROCmAMD ROCm PyTorch容器部署:兼容矩阵、设备映射、算子验证与性能排查
使用AMD验证的ROCm PyTorch容器建立GPU环境,解释/dev/kfd、/dev/dri、HIP版本、设备权限和多卡验证,并避免把CUDA教程直接套到AMD平台。
集群运维与排障AMD ROCm使用AMD验证的ROCm PyTorch容器建立GPU环境,解释/dev/kfd、/dev/dri、HIP版本、设备权限和多卡验证,并避免把CUDA教程直接套到AMD平台。
集群运维与排障Kubernetes GPU从GPU节点驱动和设备插件开始,让Kubernetes上报nvidia.com/gpu或amd.com/gpu,编写最小测试Pod,并根据事件定位资源为零、Pod Pending和异构卡误调度。
集群运维与排障DCGM Exporter在每个GPU节点部署DCGM Exporter,通过9400端口输出Prometheus指标,解释温度、功耗、显存、PCIe、Xid和健康指标,并设计避免告警噪声的规则。
推理与性能优化大模型压测建立可复现的大模型API压测矩阵,区分首Token、逐Token、端到端延迟和吞吐,并通过固定请求率、真实长度分布和质量回归确定生产容量。
集群运维与排障PyTorch从宿主机驱动到PyTorch张量、混合精度和多GPU通信逐层验收,解释nvidia-smi、nvcc与torch.version.cuda为何可能显示不同版本。
算力基础KV Cache解释KV Cache由层数、KV头、头维度、精度、上下文和并发共同决定,并用加载前后显存与阶梯压测校正理论容量。
模型部署Qwen3-32B在两张同型号GPU上部署Qwen3-32B,说明权重容量、KV Cache、PCIe/NVLink拓扑、张量并行启动、接口验证和单卡量化替代方案。
推理与性能优化TensorRT-LLM依据新版trtllm-serve流程,从NGC容器启动OpenAI兼容服务,验证health、metrics和聊天接口,并用固定请求率建立性能基线。
集群运维与排障NVIDIA Container Toolkit面向Ubuntu GPU服务器,从驱动检查、官方软件源、Docker运行时配置到CUDA容器验收,解释宿主机CUDA与容器CUDA的关系,并给出常见故障定位顺序。
模型部署vLLM从GPU容器基线开始,用vLLM官方镜像部署Qwen兼容API,详细解释缓存、IPC、上下文、显存利用率、认证、流式请求、升级回退和OOM排查。
推理与性能优化SGLang以SGLang启动OpenAI兼容服务,解释静态显存池、张量并行、前缀缓存和请求调度,并给出从单请求到混合长度压测的完整验收路线。
集群运维与排障NCCL按单卡、点对点、单机集合通信和多机网络四层排查NCCL初始化卡死与性能异常,包含拓扑读取、共享内存、网卡选择、日志采集和nccl-tests基线。
模型部署Ollama面向工作站和小型服务器,用Docker运行Ollama并持久化模型,验证GPU是否真正参与推理,设置局域网访问边界,并排查模型落到CPU、下载重复和上下文OOM。
选型与采购AI算力
集群运维与排障AI算力解决nvidia-smi正常但容器看不到GPU、CUDA版本不匹配和框架启动失败,给出准备、实施、排错和验收方法。
模型部署AI算力
模型部署AI算力
集群运维与排障AI算力
推理与性能优化AI算力
模型部署AI算力在外网不稳定或生产环境隔离时可靠交付模型文件,给出准备、实施、排错和验收方法,并提供可复核的实施步骤、风险边界与验收标准。
集群运维与排障AI算力
集群运维与排障AI算力
集群运维与排障AI算力把新到货GPU服务器整理成可审计、可回滚、可交接的基础运行环境,给出准备、实施、排错和验收方法。
推理与性能优化AI算力
模型部署AI算力将已确认许可和版本的模型转换成可重复构建的TensorRT-LLM推理引擎,给出准备、实施、排错和验收方法。
模型部署AI算力在AMD GPU服务器上建立可复核的PyTorch训练与推理基础环境,给出准备、实施、排错和验收方法。
推理与性能优化AI算力
集群运维与排障AI算力
推理与性能优化AI算力为个人工作站或边缘设备选择合适GGUF量化并确定CPU与GPU分层策略,给出准备、实施、排错和验收方法。
集群运维与排障AI算力