数据性质

本方案为S1工程模拟,不对应真实客户项目;容量数字是带假设的计算,性能值是验收目标,未提供本站实机日志。

场景与合同中的技术需求

模拟一家研发团队需要连续租用一台八卡裸金属服务器四周,先进行72小时试租。任务包含模型推理验证与有限微调,团队提供脱敏数据和固定环境。卡型号、每卡显存、整机平台、网络、磁盘、独占方式与计费规则必须写入资源清单;本篇不指定供应商,也没有真实成交或实测日志。

租赁方希望验证“交付配置与承诺一致、业务能稳定运行、数据能够清理”,而不是仅得到一张GPU数量截图。供应方应明确故障响应、更换规则、停机计费和提前结束处理。涉及合同的细则由双方依法确认,本方案只提供技术验收方法。

第一天:资源与拓扑核对

保存nvidia-smi完整查询、GPU UUID、显存、驱动和ECC状态,核对是否为约定整卡而非共享或切分资源。记录CPU、主板平台、内存、NUMA、PCIe与GPU互联。八卡PCIe与八卡SXM拓扑不是等价资源,即便GPU名称相近也要分别核对。

同时检查可用NVMe、挂载路径、磁盘健康、网卡速度与实际路由。测到外部下载速度慢先区分出口限制,不能直接认定内部GPU通信异常。只测试获授权的资源和接口,不扫描供应商其他租户。

第二天:通信与持续运行

使用供应方确认的通信库与测试工具,在独立测试目录执行八卡集合通信,覆盖多个消息大小,保留原始输出、版本和拓扑。带宽测试的busbw与algbw是不同口径,不能随意与链路标称速度比较。出现掉卡、Xid或温度异常应暂停业务并记录时间。

测试同时观察逐卡利用率、功耗、温度和错误计数。连续运行至少覆盖一个完整业务周期,日志中保留空闲、加载、计算和恢复阶段。平均利用率不能掩盖某张卡持续异常,也不能用短时满载证明长任务稳定。

第三天:业务容量与质量

推理任务固定模型revision、精度、框架与请求集,分别测试短问答、长上下文和并发。记录首字、末字、完成率和逐卡显存。微调任务固定数据、batch、序列长度与优化器,测step时间、检查点保存和恢复;只报告完成的step,不遗漏OOM和失败尝试。

设计通过条件由业务需求确定,例如普通API P95首字不超过5秒、完成率至少99%、训练检查点可恢复。这些是验收目标,不代表八卡一定达到。供应商给出的历史速度只能作为参考,不替代本任务结果。

时间与费用口径

72小时试租至少划分环境准备、技术测试与报告整理。若准备耗时12小时、测试48小时、整理12小时,就不能把全天都算成有效训练时间。正式四周即28天、672小时,计费是否包含加载、空闲、故障与预留资源要逐项确认。

设试验期有效任务时间48小时、计费72小时,则有效利用比例为66.7%。这个比例来自时间安排示例,不是平台实际利用率。按同样任务完成量比较租赁成本,另外列出存储、带宽、技术支持和迁移成本。报价必须注明日期、税费与资源形态,不用过期单价计算宣传收益。

故障演练不能破坏硬件

在获授权的维护窗口停止测试进程,确认任务重启与检查点恢复;不通过强制重置GPU、断电或删除系统文件测试生产设备。保存恢复前后步数、数据游标与模型结果,排除从头重跑却被称为恢复的情况。

备用资源切换应重新核对UUID、驱动与模型文件。新节点即使型号相同,拓扑和性能也可能不同。供应商更换资源后复跑最小质量与通信测试,保留变更记录。

变更与每日巡检

租期内每天保留资源健康摘要、错误计数和任务完成量。供应方调整驱动、网络或设备必须提前记录变更窗口,客户在变更后跑固定小任务核对结果。出现异常时先保存现场日志,再协商更换与暂停计费,不在没有证据的情况下持续重装环境。业务模型和数据更新也要记录,防止将自己的负载变化误判为供应资源退化。

退租前的数据清理

下载必要日志、模型和检查点,核对哈希与备份后再清理获授权的专用数据目录。删除容器不等于删除卷、镜像层、临时文件或对象存储。由供应方提供介质清理与权限撤销流程,客户验证账号、令牌和临时链接已经失效。共享资源的底层清理由供应方按约定执行,不自行操作其他租户空间。

最终交付包包含配置表、拓扑、版本、测试输入、原始结果、失败记录、费用口径与数据处理确认。网昱的对接价值可以落实为这份可比较的技术清单,而不是只有出租信息与联系方式。参考:NVIDIA DCGM、vLLM压测方法。

案例编制与证据说明

本案例由网昱算力学院按公开技术资料和工程约束编制,用于展示方案设计与验收方法,不对应真实客户项目。配置和性能数字必须在目标硬件、软件版本与业务数据上重新验证。

编制方式
工程模拟
客户授权证据
未提供
原始测试日志
未公开