适配结论余量不足1 × 24GB,共 24GB物理显存
- 模型权重
- 16.4 GB
- KV Cache
- 2.5 GB
- 框架与运行开销
- 2.5 GB
- 安全余量
- 3.2 GB
结果怎么理解
当前主要显存消耗来自模型权重,量化精度是影响容量的首要因素。
需求已略高于物理显存,仅在卸载或更激进优化下可能运行,不适合作为稳定方案。
容量可行的参考组合
- 1 × GeForce RTX 5090 32GB余量充足 · 32GB · GPU功耗约575W
- 1 × RTX 6000 Ada 48GB余量充足 · 48GB · GPU功耗约300W
- 1 × NVIDIA L40S 48GB余量充足 · 48GB · GPU功耗约350W
- 1 × NVIDIA A100 80GB余量充足 · 80GB · GPU功耗约400W
说明:采用标准Transformer近似。MoE仍按完整权重估算;未单独建模GQA、CPU卸载、分布式通信和特定框架优化。
