数据性质与适用范围
本篇为S1工程模拟方案,按公开技术资料与明确的业务假设编制。容量计算使用文中假设;验收数值是待验证目标,没有本站实机测试日志。实际交付应保存硬件、版本、请求集和原始结果,再确定服务能力。
迁移对象先冻结
模拟一家企业将内部知识问答迁移到国产加速平台。原服务使用32B模型,日均5000次调用,峰值20个活跃请求,上下文限制8K。业务已有检索、权限、流式接口和审计;迁移的目标是替换推理资源,不能在同一窗口同时升级模型、重做检索和改变回答格式,否则结果差异无法定位。
试点保留旧平台,新增一台八卡国产加速服务器。采购设计要求为单卡至少64GB可用标称内存级别,实际卡型、HBM容量和互联由交付清单确认;不同厂家、代际和固件不能统称为同一性能。本文以昇腾软件生态作为适配示例,其他国产平台需要独立驱动与算子路线,不能直接复用命令。
版本矩阵比安装步骤更重要
整机平台需由厂商确认主板、CPU架构、加速卡、PCIe映射、电源与散热,并提供可维护BMC。至少512GB主内存、NVMe模型盘与双25GbE业务网络。CPU是x86还是ARM会影响镜像架构、依赖和编译产物,应在拿到设备前确认。
矩阵记录操作系统、内核、驱动、固件、CANN、框架、torch-npu、vLLM及Ascend插件对应版本,再记录模型revision、精度、量化格式和并行参数。官方支持范围是起点,仍须测试本项目用到的流式输出、停止词、结构化输出和长上下文,不能把“模型名称在列表中”当作全部功能验收。
三阶段逐层定位
第一阶段使用7B模型、单卡、1K输入与128输出,确认设备枚举、权重加载、文本编码与确定性短回答。第二阶段加载32B,先以低并发运行相同请求集,再验证两卡或多卡并行。第三阶段接入旧系统的真实接口、检索内容、用户身份和取消逻辑。八张卡可部署多个实例,不能预设32B必须占满八卡,也不能预设卡越多延迟越低。
错误定位按硬件健康、驱动固件、模型加载、算子支持、聊天模板、接口行为顺序进行。若单卡正常而多卡失败,重点检查集合通信、地址与拓扑;若仅长输入失败,检查缓存和位置编码支持;若回答出现特殊标记,先核对模板与分词器版本。
同题质量回归与性能目标
建立400题验收集:200题有明确业务答案,100题需引用资料,50题结构化输出,50题为缺资料与边界输入。两平台使用同一检索片段和提示词,保留完整输入,固定可固定的随机参数。即便相同精度也可能存在数值差异,所以比较任务正确性和格式合规性,不要求所有自然语言逐字一致。
设计门槛为业务正确率相对旧平台下降不超过2个百分点,关键字段题不得新增严重错误;流式首字P95不超过4秒,20并发30分钟错误率低于1%。性能是项目目标,未有本机实测前不宣称国产平台已经达到或超过旧平台。还需记录每卡显存、功耗、排队和每请求成本,才能判断迁移价值。
灰度发布与回退约束
流量按1%、5%、20%、50%逐级增加,每级至少覆盖一次工作高峰。网关路由记录平台与模型版本,并保留旧平台容量。只有未开始输出的请求可安全切换重试;已经流式回答的请求在失败后明确提示,不能把两平台输出拼接。
迁移上线前演练新实例退出、加速卡不可见和长任务取消。监控按平台展示错误率,出现连续异常或关键质量问题时回到旧路由,并保存有问题的请求ID。生产切换与关闭旧平台是两个决定,完成稳定观察后再评估是否缩减旧资源。
最终交付不是一张速度表
交付包括版本矩阵、可复用镜像、算子与功能支持清单、400题原始回归结果、压测记录、升级回退脚本和仍未支持的功能。方案适合对数据本地化和国产化有要求且能够保留双平台验证期的企业;无法提供业务验收集时,应先建设验证体系再决定整体迁移。
技术依据与复现资料
- vLLM Ascend官方适配文档:https://docs.vllm.ai/projects/ascend/en/latest/
本案例由网昱算力学院按公开技术资料和工程约束编制,用于展示方案设计与验收方法,不对应真实客户项目。配置和性能数字必须在目标硬件、软件版本与业务数据上重新验证。
- 编制方式
- 工程模拟
- 客户授权证据
- 未提供
- 原始测试日志
- 未公开

