SOFTWARE SELECTION PROFILE

TensorRT-LLM

NVIDIA面向大语言模型的推理优化与服务组件,支持量化、张量并行和高性能内核。
资料更新:2026-07-27官方资料来源 →

核心规格

厂商/维护方
NVIDIA
许可证
Apache 2.0(仓库组件,依赖项另有许可)
软件类型
大模型推理框架
相关组件
CUDA、TensorRT、Triton Inference Server
操作系统
Linux
支持硬件
NVIDIA GPU

软件与部署生态

软件兼容信息正在补充。

部署与采购注意事项

  • 严格核对CUDA、TensorRT-LLM和GPU架构版本
  • 性能测试必须固定模型、精度、批量和输入输出长度

不适合或需要谨慎的场景

  • AMD或Intel GPU
  • 模型频繁变化且无法维护构建产物的团队
HOW TO USE THIS PROFILE

不要用单个参数直接作出采购决定

权重显存只是部署下限。真实服务还需要预留KV Cache、批处理、上下文、框架运行开销和安全余量;MoE模型的激活参数也不能代替完整权重容量。

WANGYU COMPUTE SERVICE

需要形成正式方案时,由网昱继续推进

提交当前页面和项目条件,网昱将从模型、并发、硬件平台、预算与交付边界继续核对,并明确下一步交付物。