先告诉我们,你要解决什么问题?
不需要先理解所有技术参数,从你的设备或目标模型开始。
从一个对象,连接完整的算力决策信息
软件与框架
当前收录 22 条资料,可按关键词、厂商、显存和使用场景缩小范围。
CUDA
NVIDIA GPU通用并行计算平台,是PyTorch、TensorRT及大量AI算子的基础依赖。
DeepSpeed
微软开源的深度学习训练优化库,覆盖ZeRO、并行训练、混合精度和大模型推理。
Docker
容器镜像与运行时工具,是固定AI应用依赖、交付GPU服务和复现实验环境的基础设施。
Hugging Face Transformers
覆盖文本、视觉、语音和多模态任务的模型加载、训练与推理基础库。
KServe
基于Kubernetes的模型推理平台,提供服务编排、弹性伸缩、流量管理和多种模型运行时。
Kubernetes
容器编排平台,可用于GPU调度、模型服务部署、弹性扩缩和集群资源管理。
NCCL
NVIDIA多GPU和多节点集合通信库,是分布式训练及张量并行的重要底层组件。
NVIDIA Driver
NVIDIA GPU宿主驱动,决定硬件识别、CUDA运行时上限和容器访问GPU的基础能力。
ONNX Runtime
跨平台模型推理运行时,支持CPU、CUDA、TensorRT、DirectML等执行提供程序。
Ollama
面向本地模型下载、运行与API调用的易用工具,适合快速验证和个人应用。
OpenMPI
开源消息传递接口实现,常用于HPC和部分多节点AI训练启动与通信。
PyTorch
主流深度学习框架,覆盖模型训练、推理、分布式计算与丰富的AI生态。
ROCm
AMD面向GPU计算、机器学习和HPC的开放软件栈,覆盖HIP、通信库、数学库与框架适配。
Ray Serve
Ray生态中的可扩展在线推理框架,支持Python组合、多模型流水线和分布式副本。
SGLang
面向大模型和多模态模型的高性能服务框架,提供推理运行时、结构化生成和服务接口。
TensorFlow
覆盖模型训练、推理、分布式计算和生产部署的深度学习框架。
TensorRT
NVIDIA面向深度学习推理的优化SDK,适合在支持的GPU上构建低延迟、高吞吐引擎。
TensorRT-LLM
NVIDIA面向大语言模型的推理优化与服务组件,支持量化、张量并行和高性能内核。
Triton Inference Server
NVIDIA开源推理服务器,统一托管TensorRT、ONNX Runtime、PyTorch及自定义后端模型。
cuDNN
NVIDIA为深度神经网络提供的GPU加速库,被PyTorch、TensorFlow等框架作为底层依赖。
llama.cpp
以C/C++实现的轻量大模型推理项目,适合GGUF量化、CPU和消费级设备本地部署。
vLLM
面向大语言模型的高吞吐推理与OpenAI兼容服务框架,支持连续批处理和PagedAttention。
查完参数,下一步是形成方案
显存估算、GPU 适配和服务器配置已经可以使用。后续将继续增加产品比较、软件兼容、成本估算和方案导出。
