vLLM官方文档参数索引:显存、并行、上下文与服务接口
vLLM参数会同时影响模型能否加载、KV缓存容量、并发吞吐和接口兼容性,本文整理阅读顺序、工程重点和验证方法。
集中查找模型、芯片、系统、标准和软件版本资料,并核对发布机构、更新时间与适用范围。
当前收录 8 份资料,可查看中文导读、资料出处,并在线阅读或下载允许本站保存的原始文件。
vLLM参数会同时影响模型能否加载、KV缓存容量、并发吞吐和接口兼容性,本文整理阅读顺序、工程重点和验证方法。
Transformers文档覆盖模型加载、device map、低精度、缓存和自定义代码,本文整理阅读顺序、工程重点和验证方法。
SGLang覆盖模型服务、结构化生成、缓存与分布式推理,版本变化较快,本文整理阅读顺序、工程重点和验证方法。
GPU Operator用于在Kubernetes中管理驱动、Container Toolkit、Device Plugin、DCGM监控等组件,本文整理阅读顺序、工程重点和验证方法。
DCGM为数据中心GPU提供遥测、健康检查和诊断能力,是集群监控与故障证据的重要来源,本文整理阅读顺序、工程重点和验证方法。
AI推理监控容易因模型、租户和请求标签产生高基数,必须在接入阶段约束指标设计,本文整理阅读顺序、工程重点和验证方法。
NCCL是多GPU集合通信基础,网络选择和拓扑直接影响训练扩展效率,本文整理阅读顺序、工程重点和验证方法。
CUDA语义文档解释设备选择、异步执行、CUDA stream、内存分配器和精度行为,本文整理阅读顺序、工程重点和验证方法。
每份资料注明发布机构、原文标题、更新时间和许可信息;允许本站保存的文件可直接在线阅读和下载,其他资料提供中文导读与官方来源。