← 返回AI算力选型库

SOFTWARE SELECTION PROFILE

vLLM

面向大语言模型的高吞吐推理与OpenAI兼容服务框架,支持连续批处理和PagedAttention。
资料更新:2026-07-24官方资料来源 →

核心规格

厂商/维护方
vLLM Project
许可证
Apache 2.0
软件类型
大模型推理框架
相关组件
PyTorch、CUDA、ROCm、Ray、Kubernetes
操作系统
Linux
支持硬件
NVIDIA CUDA、AMD ROCm、部分Intel与其他后端

软件与部署生态

软件兼容信息正在补充。

部署与采购注意事项

  • 根据并发和上下文设置GPU内存利用率、最大序列与批处理参数
  • 升级前检查模型、量化方式和GPU后端兼容性

不适合或需要谨慎的场景

  • 资源很小的纯CPU设备
  • 模型架构或量化格式尚未支持的场景
HOW TO USE THIS PROFILE

不要用单个参数直接作出采购决定

权重显存只是部署下限。真实服务还需要预留KV Cache、批处理、上下文、框架运行开销和安全余量;MoE模型的激活参数也不能代替完整权重容量。

WANGYU COMPUTE SERVICE

让网昱继续核对这份算力方案

结合模型、并发、硬件平台、预算和交付条件,进一步确认配置边界,或匹配可租算力资源。