数据性质与适用范围

本篇为S1工程模拟方案,按公开技术资料与明确的业务假设编制。容量计算使用文中假设;验收数值是待验证目标,没有本站实机测试日志。实际交付应保存硬件、版本、请求集和原始结果,再确定服务能力。

共享目标是小服务稳定运行

模拟一个企业平台组,六个项目分别运行嵌入、重排、文本分类和1.5B级小模型问答。现有两张H100 80GB,项目负载经常不同时出现,但直接让多个进程抢一整张卡会造成显存竞争。目标是给小服务明确资源边界和监控,而不是用MIG替代所有大模型GPU需求。

整机使用服务器认证平台、256GB以上ECC、NVMe模型盘和25GbE。卡型是PCIe还是SXM、驱动版本、MIG支持与具体profile均写入资产清单。以下以H100 80GB支持的1g.10gb作为小实例候选,最多实例数与组合以官方表和本机枚举为准;切分后的显存不能自动合并成大模型需要的空间。

从实例到租户的映射

先配置一张卡用于小实例试点,另一张保留整卡给较大任务。资产表记录物理GPU UUID、MIG实例UUID、profile、租户、服务、模型和调度节点。实例重建可能改变标识,业务不能把旧UUID长期写死在个人脚本里。

在Kubernetes等调度环境使用官方支持的设备插件配置,管理员发布明确的MIG资源类型,租户仅申请获准资源。镜像与模型目录按项目隔离,服务入口鉴权与并发限流。GPU计算和显存隔离不自动解决主内存、CPU、磁盘、网络或容器权限问题,每个项目同时设置这些配额。

10GB实例够不够要逐服务验证

1.5B模型BF16主体权重约3GB十进制,运行时和KV Cache另计,不能据此保证10GB实例能承载任意上下文和并发。先固定2K输入、256输出、1并发,观察峰值,再试2与4并发。嵌入服务按批量与文本长度测,重排按候选条数测,三种服务不能共用一个“每秒请求数”排名。

如果某个服务在10GB实例持续接近上限,先限制请求预算,或者选择更大profile;不要绕过调度借用其他实例内存。大模型、跨实例训练和需要特定互联功能的任务另建整卡队列,并逐项核对当前MIG条件下是否支持。

验收看彼此干扰和整机资源

先分别压测每个租户,再让一个租户持续高负载,同时观察其他租户P95时延。设计目标为非压力租户相对独占基线恶化不超过15%,CPU和存储告警可定位到具体项目。这个门槛需要实机验证;MIG隔离不能阻止共享磁盘写满或主机网络拥堵。

每次测试记录实例profile、显存、利用率、错误、主机CPU、内存和IO。用24小时混合流量观察峰谷,统计实际GPU小时和排队。计费或内部摊销依据约定资源时间,不能把切分实例数量误认为“虚拟出了更多算力”。

调整profile必须安排维护

切分变更涉及设备和工作负载状态,应先停止接收新请求、排空相关服务、保存配置并确认恢复入口,然后在维护窗口操作。不要承诺在线无损调整所有profile。两张卡都在同一主机时,主机故障仍可能使所有租户服务一起退出,需要跨节点副本才能提高可用性。

运行中的实例异常先查看进程和设备健康,按支持流程重启对应服务;不要直接重置整卡影响其他租户。维护后重新枚举实例,把资源清单与调度器对齐,再恢复流量。更新驱动前备份当前版本矩阵和实例布局。

交付与扩容方向

交付租户矩阵、profile清单、设备插件配置、单租户与混合负载结果、维护排空步骤和告警路由。适用于小模型、嵌入与轻量推理的资源边界管理;如果大多数任务需要整卡或大显存,整卡调度更合适。第二阶段应把关键服务副本放到独立节点,避免把同机两张卡误当成完整容灾。

技术依据与复现资料

  • NVIDIA MIG官方支持配置:https://docs.nvidia.com/datacenter/tesla/mig-user-guide/latest/supported-mig-profiles.html
案例编制与证据说明

本案例由网昱算力学院按公开技术资料和工程约束编制,用于展示方案设计与验收方法,不对应真实客户项目。配置和性能数字必须在目标硬件、软件版本与业务数据上重新验证。

编制方式
工程模拟
客户授权证据
未提供
原始测试日志
未公开