数据性质与适用范围

本篇为S1工程模拟方案,按公开技术资料与明确的业务假设编制。容量计算使用文中假设;验收数值是待验证目标,没有本站实机测试日志。实际交付应保存硬件、版本、请求集和原始结果,再确定服务能力。

为什么不能只比较文件大小

模拟一个企业技术团队,正在选择32B模型的部署精度。设备固定为双L40S 48GB、256GB ECC内存、NVMe模型盘和双25GbE。业务每天需要约2000次中文问答,部分答案包含金额、日期、代码和结构化字段。团队希望减少显存占用,同时保持业务答案可靠,不能只依据“4位下载更小”决定上线。

复现对象固定为Qwen2.5-32B-Instruct。BF16、8位和4位候选必须能够追溯到同一个基础模型revision;记录量化方法、校准数据、分组大小和转换工具版本。8位权重、FP8计算、8位KV Cache是不同的选择,测试表要逐项列明,不能全部写成一个“INT8”标签。

显存预算先做粗筛

按320亿参数主体估算,BF16约64GB,8位约32GB,4位约16GB,均为十进制字节量级。实际还有缩放系数、未量化张量、运行时、通信与KV Cache,尤其不能把4位权重大小当成整机峰值显存。双48GB可作为BF16验证起点,具体8K并发能力仍取决于缓存与引擎分配。

本轮比较全部采用两张GPU,保持相同张量并行与请求上限;后续可以单独测试“4位单卡部署”的成本,但不能把单卡结果混入公平的双卡精度对照。硬件记录包括主板平台、插槽映射、GPU型号、固件、驱动和功率限制,保证下一位工程师能复现环境。

业务题与人工评分

准备300题:100题知识问答、60题金额与日期、60题JSON字段、50题代码、30题信息缺失时的拒答。每题有标准事实、必要字段及错误等级。量化校准样本与验收题分开,校准过的内容不能再作为唯一质量依据。两名人员独立盲评,意见不同的题交第三人复核。

输出正确性按业务任务判断,不能要求自然语言逐字相同。金额错误、虚构文档出处、代码依赖不存在列为严重错误;格式差异另计。设计门槛为总体通过率相对BF16下降不超过2个百分点,严重错误不得增加,结构化输出可解析率至少99%。这些门槛需要业务负责人确认,并非通用模型质量标准。

性能对照与采样记录

建立1K/256、4K/512、8K/1024三组输入输出token预算,分别测1、4、8、16并发。每档先预热,再运行至少15分钟,冷热缓存分开。记录每请求排队、首字、完成时间、实际输出token、结束原因和错误;同时保存每卡显存、功率与利用率。

聚合吞吐使用完成输出tokens除以完整观测窗口,不能只算最快请求。P95首字应包含排队,超时和OOM作为失败计入。随机改变方案测试顺序,避免把系统缓存和机房温度变化误认为精度改进。每种精度至少重复三轮,报告波动范围而不是挑最好的一次。

成本怎样与质量一起算

每千输出token能耗可以按观测窗口整机耗电kWh÷输出token×1000计算。还需加入GPU占用时间、维护和人工审核成本,不能仅用显卡标称功率替代墙上功耗。若4位增加严重错误,即使吞吐更高,也可能让业务总成本上升。

假设业务每小时输出需求为10万token,实测候选每小时完成12万且错误率符合门槛,那么只有20%吞吐余量;需求翻倍不能靠既有结果保证。这里的数字用于说明容量判断方法,正式表格必须填本机结果,不预先给三个精度编造排名。

选择与回退

先保留BF16作为质量基线。候选精度通过后,只对低风险业务灰度5%流量,观察金额、代码和JSON错误,再逐步扩大。模型文件、引擎镜像与聊天模板一同版本化,量化升级失败可回到已验收组合。

交付300题评分、全部请求CSV、显存时间线、能耗记录和候选限制。结论应写“在本业务与本硬件条件下哪个方案通过”,不写“4位永远更快”或“8位没有损失”。对于高风险业务,保留人工复核和更高精度路由。

技术依据与复现资料

  • Qwen2.5-32B官方配置:https://huggingface.co/Qwen/Qwen2.5-32B-Instruct/blob/main/config.json
  • vLLM官方量化支持文档:https://docs.vllm.ai/en/latest/features/quantization/
案例编制与证据说明

本案例由网昱算力学院按公开技术资料和工程约束编制,用于展示方案设计与验收方法,不对应真实客户项目。配置和性能数字必须在目标硬件、软件版本与业务数据上重新验证。

编制方式
工程模拟
客户授权证据
未提供
原始测试日志
未公开