先回答能不能装下,再回答能不能服务

NVIDIA官方RTX 5090规格为32GB GDDR7,参考总显卡功耗575W。不同地区型号、非公版尺寸与供电设计应分别核对,不能把这一规格自动套到所有名称带5090的产品。本文做容量推算,不提供未经本站测试的token速度或购买价格。

以32B稠密模型为例,BF16主体权重约为32×10亿×2字节,即64GB十进制量级;INT8主体约32GB;INT4主体约16GB。量化还存在缩放、零点、非量化层及分配开销,文件大小与加载后占用不同。单张32GB显卡部署32B BF16显然不应作为默认方案,INT8也几乎没有给运行时与缓存留下空间。

量化模型需要匹配执行路径

INT4只是大类,AWQ、GPTQ与GGUF的加载和算子不同。推理框架是否支持模型架构、量化格式与Blackwell内核,必须在目标版本验证。更小的文件未必更快,反量化与访存可能改变收益。采购前要求供应方提供完整环境,而不是一句“支持4bit”。

上下文决定剩余空间怎样消耗

在常规全注意力模型中,KV缓存大致由层数、KV头数、头维度、序列长度、活跃请求和缓存精度共同决定。使用GQA会减少KV头,但不能把参数量直接换算为缓存。滑动窗口或其他注意力结构也可能改变估算方式。

试验可先为权重与运行时测一个空载值,再以4K、8K、16K三档输入运行1、2、4并发。记录每卡显存、首字、请求完成率和抢占。不要先把最大上下文写进宣传页,再发现只能让一个用户勉强使用。

采购清单不只有显卡

575W是参考显卡指标,不是整机墙上功耗。CPU、内存、风扇、存储和电源效率还要另计,峰值与线材要求按整机和显卡厂商指导确认。核对机箱空间、接口弯折余量、进风与热排风路径;多张大尺寸显卡不能仅凭主板有插槽就判定能安装。

对部门问答平台,若一张卡的量化32B无法满足并发,先比较限制长请求、增加独立实例和更大显存卡。每种方案使用相同质量与时延目标,再核算价格、电费与运维。结论应来自目标业务压测,而不是从理论峰值算力推导。

资料:NVIDIA RTX 5090规格、显存计算工具。

来源、翻译与版权说明

来源:网昱算力学院 · 技术编辑。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
ZH
原文更新时间
未提供
许可证
原创工程内容