GPU显卡64GB
64GB HBM2e的PCIe数据中心加速器,适合ROCm开发、HPC和单卡大容量实验。
- 显存
- 64 GB
- 功耗
- 300 W
- 带宽
- 1.6 TB/s
GPU显卡128GB
128GB HBM2e的CDNA 2双Die加速器,适合ROCm HPC、科学计算和存量训练平台。
- 显存
- 128 GB
- 功耗
- 560 W
- 带宽
- 3.2 TB/s
GPU显卡192GB
192GB HBM3的CDNA 3数据中心加速器,适合大模型训练、推理和高带宽HPC。
- 显存
- 192 GB
- 功耗
- 750 W
- 带宽
- 5.3 TB/s
GPU显卡256GB
256GB HBM3e的大容量数据中心加速器,适合超大模型推理和内存密集型AI任务。
- 显存
- 256 GB
- 功耗
- —
- 带宽
- 6 TB/s
GPU显卡32GB
32GB ECC专业工作站GPU,适合ROCm开发、视觉工作和中型模型本地推理。
- 显存
- 32 GB
- 功耗
- 260 W
- 带宽
- 0.576 TB/s
GPU显卡48GB
48GB专业工作站GPU,适合ROCm开发、可视化和容量优先的单机模型实验。
- 显存
- 48 GB
- 功耗
- 295 W
- 带宽
- 0.864 TB/s
GPU显卡24GB
24GB显存的RDNA 3消费级GPU,适合愿意验证ROCm兼容性的本地模型与图像生成用户。
- 显存
- 24 GB
- 功耗
- 355 W
- 带宽
- 0.96 TB/s
GPU显卡24GB
24GB显存的成熟消费级GPU,二手市场常见,适合本地模型推理、图像生成和个人研究。
- 显存
- 24 GB
- 功耗
- 350 W
- 带宽
- 0.936 TB/s
GPU显卡16GB
16GB显存的Ada消费级GPU,适合7B至14B模型、图像生成和个人AI开发。
- 显存
- 16 GB
- 功耗
- 285 W
- 带宽
- 0.672 TB/s
GPU显卡16GB
16GB显存的Ada消费级GPU,功耗和性能较均衡,适合中小模型、视觉生成和桌面AI开发。
- 显存
- 16 GB
- 功耗
- 320 W
- 带宽
- 0.736 TB/s
GPU显卡24GB
24GB显存的成熟消费级AI开发卡,生态完善、性价比较高,适合个人和小型工作室。
- 显存
- 24 GB
- 功耗
- 450 W
- 带宽
- 1.008 TB/s
GPU显卡16GB
16GB显存的Blackwell消费级GPU,适合本地中小模型、图像生成和AI开发,但容量边界比算力更早出现。
- 显存
- 16 GB
- 功耗
- 360 W
- 带宽
- —
GPU显卡32GB
面向本地大模型、生成式图像和高性能工作站的旗舰消费级GPU。32GB显存适合中型量化模型,但无多卡NVLink。
- 显存
- 32 GB
- 功耗
- 575 W
- 带宽
- 1.792 TB/s
GPU显卡16GB
16GB显存的Intel消费级GPU,可用于OpenVINO、oneAPI和部分本地模型推理实验。
- 显存
- 16 GB
- 功耗
- 225 W
- 带宽
- 0.56 TB/s
GPU显卡96GB
96GB HBM2e的训练与推理加速器,使用SynapseAI软件栈和RoCE横向互联。
- 显存
- 96 GB
- 功耗
- 600 W
- 带宽
- 2.45 TB/s
GPU显卡128GB
128GB HBM2e的训练与推理加速器,面向大模型多卡和以太网扩展集群。
- 显存
- 128 GB
- 功耗
- 900 W
- 带宽
- 3.7 TB/s
GPU显卡24GB
24GB ECC显存的低功耗数据中心GPU,兼顾AI推理、图形和虚拟工作站。
- 显存
- 24 GB
- 功耗
- 150 W
- 带宽
- 0.6 TB/s
GPU显卡80GB
成熟的Ampere数据中心GPU,支持HBM2e、NVLink和MIG,适合存量训练集群与稳定生产环境。
- 显存
- 80 GB
- 功耗
- 400 W
- 带宽
- 2.039 TB/s
GPU显卡24GB
24GB HBM2数据中心GPU,支持MIG与NVLink,适合推理、训练和HPC混合负载。
- 显存
- 24 GB
- 功耗
- 165 W
- 带宽
- 0.933 TB/s
GPU显卡48GB
48GB ECC显存的Ampere数据中心PCIe GPU,兼顾视觉、虚拟工作站和中型模型推理。
- 显存
- 48 GB
- 功耗
- 300 W
- 带宽
- 0.696 TB/s
GPU显卡180GB
180GB HBM3e的Blackwell数据中心GPU,面向大模型训练、推理和高密度HGX/DGX平台。
- 显存
- 180 GB
- 功耗
- 1000 W
- 带宽
- 8 TB/s
GPU显卡80GB
面向数据中心训练和推理的Hopper加速器,具备HBM3、NVLink、MIG与企业级RAS能力。
- 显存
- 80 GB
- 功耗
- 700 W
- 带宽
- 3.35 TB/s
GPU显卡141GB
141GB HBM3e数据中心GPU,重点提升大模型推理所需的显存容量和带宽。
- 显存
- 141 GB
- 功耗
- 700 W
- 带宽
- 4.8 TB/s
GPU显卡24GB
24GB低功耗数据中心GPU,面向视频、视觉和生成式AI推理,适合高密度PCIe服务器。
- 显存
- 24 GB
- 功耗
- 72 W
- 带宽
- 0.3 TB/s
GPU显卡48GB
48GB ECC显存的PCIe数据中心GPU,兼顾生成式AI推理、训练、图形和视频工作负载。
- 显存
- 48 GB
- 功耗
- 350 W
- 带宽
- 0.864 TB/s
GPU显卡48GB
48GB ECC显存的Ampere专业工作站GPU,支持NVLink,适合大显存开发和专业可视化。
- 显存
- 48 GB
- 功耗
- 300 W
- 带宽
- 0.768 TB/s
GPU显卡16GB
16GB低功耗Turing数据中心GPU,生态成熟,适合存量推理、视频和轻量AI服务。
- 显存
- 16 GB
- 功耗
- 70 W
- 带宽
- 0.32 TB/s
GPU显卡32GB
32GB HBM2的Volta数据中心GPU,仍常见于存量训练集群和云资源。
- 显存
- 32 GB
- 功耗
- 300 W
- 带宽
- 0.9 TB/s
GPU显卡48GB
48GB ECC显存的专业工作站GPU,功耗相对温和,适合稳定的模型开发、推理和专业可视化。
- 显存
- 48 GB
- 功耗
- 300 W
- 带宽
- 0.96 TB/s
GPU显卡96GB
96GB ECC显存的专业工作站GPU,适合大模型开发、专业可视化和需要认证驱动的持续负载。
- 显存
- 96 GB
- 功耗
- 600 W
- 带宽
- —
AI模型
百川智能发布的13B中英双语对话模型,适合中文问答、研究和存量私有化项目。
- 参数量
- 13B
- 上下文
- 4096
- 建议显存
- BF16:32;INT4推理:12
AI模型
16B总参数、约2.4B激活参数的MoE代码模型,适合本地代码生成和多语言编程任务。
- 参数量
- 16B
- 上下文
- 131072
- 建议显存
- INT4推理:12;BF16或长上下文:40
AI模型
面向复杂推理的MoE模型;完整版本部署门槛高,通常使用API或蒸馏版本。
- 参数量
- 671B
- 上下文
- 131072
- 建议显存
- 完整模型:1400;蒸馏版本:24
AI模型
将DeepSeek-R1推理能力蒸馏到Qwen 32B底座,适合本地数学、代码与复杂推理。
- 参数量
- 32.8B
- 上下文
- 131072
- 建议显存
- BF16:80;INT4单用户:24;INT8或长上下文:48
AI模型
将DeepSeek-R1推理能力蒸馏到Qwen 7B底座,适合个人设备上的推理实验和教学。
- 参数量
- 7.6B
- 上下文
- 131072
- 建议显存
- INT4推理:8;长上下文或BF16:24
AI模型
671B总参数、37B激活参数的MoE基础模型,面向高质量通用与代码任务。
- 参数量
- 671B
- 上下文
- 131072
- 建议显存
- 完整模型:1400
AI模型
智谱开源的中英双语9B模型,支持长上下文、工具调用和本地应用开发。
- 参数量
- 9B
- 上下文
- 131072
- 建议显存
- INT4推理:12;BF16或长上下文:24
AI模型
Google开放权重的27B文本模型,适合单机高质量问答、研究和私有化推理。
- 参数量
- 27B
- 上下文
- 8192
- 建议显存
- BF16:64;INT4推理:24
AI模型
Google开放权重的9B文本模型,适合本地问答、研究和资源有限的应用。
- 参数量
- 9B
- 上下文
- 8192
- 建议显存
- BF16:24;INT4推理:12
AI模型
Google开放权重多模态模型,支持文本和图像输入,适合单机多模态应用。
- 参数量
- 27B
- 上下文
- 131072
- 建议显存
- BF16:64;INT4推理:24
AI模型
上海AI实验室发布的中英双语7B对话模型,适合工具调用、RAG和本地研究。
- 参数量
- 7B
- 上下文
- 32768
- 建议显存
- INT4推理:8;BF16或长上下文:20
AI模型
面向图像、文档和多模态问答的8B视觉语言模型,适合OCR后处理和图表理解。
- 参数量
- 8B
- 上下文
- 32768
- 建议显存
- 基础推理:16;高分辨率多图:24
AI模型
70B级通用开放权重模型,适合高质量问答、RAG和企业私有化服务。
- 参数量
- 70B
- 上下文
- 131072
- 建议显存
- BF16:160;INT8:96;INT4低并发:48
AI模型
生态成熟的8B开放权重模型,适合本地实验、英文应用、微调和端侧原型。
- 参数量
- 8B
- 上下文
- 131072
- 建议显存
- 基础推理:12;长上下文或微调:24
AI模型
轻量级开放权重文本模型,适合端侧原型、摘要、分类和资源有限的本地应用。
- 参数量
- 3B
- 上下文
- 131072
- 建议显存
- INT4推理:4;BF16或长上下文:12
AI模型
面向高质量文本任务的70B指令模型,生态成熟,适合企业RAG和私有化服务。
- 参数量
- 70B
- 上下文
- 131072
- 建议显存
- BF16:160;INT8:96;INT4低并发:48
AI模型
面向端侧和轻量部署的多模态模型,支持图像理解、OCR和视频内容分析。
- 参数量
- 8B
- 上下文
- 32768
- 建议显存
- 量化推理:8;高分辨率或视频:16
AI模型
生态成熟的7B开放权重指令模型,适合英文应用、函数调用和资源有限的本地部署。
- 参数量
- 7.3B
- 上下文
- 32768
- 建议显存
- BF16:20;INT4推理:8
AI模型
24B级多模态指令模型,适合单机高质量问答、文档理解和函数调用。
- 参数量
- 24B
- 上下文
- 131072
- 建议显存
- BF16:64;INT4推理:20
AI模型
稀疏MoE指令模型,兼顾较强能力与每Token较低激活参数,适合多卡推理和研究。
- 参数量
- 46.7B
- 上下文
- 32768
- 建议显存
- BF16:120;INT4:32;INT8:64
AI模型
微软发布的14B级小型语言模型,适合推理、代码和资源有限的本地部署。
- 参数量
- 14B
- 上下文
- 16384
- 建议显存
- INT4推理:12;BF16或微调:32
AI模型
72B级中英双语通用模型,适合企业RAG、高质量问答和私有化服务。
- 参数量
- 72.7B
- 上下文
- 131072
- 建议显存
- BF16:160;INT8:96;INT4低并发:48
AI模型
成熟的7B级中英双语指令模型,适合本地问答、RAG、工具调用和轻量微调。
- 参数量
- 7.6B
- 上下文
- 131072
- 建议显存
- INT4推理:8;BF16或长上下文:24
AI模型
面向代码生成、补全、解释和修复的32B代码模型,适合私有代码库与开发辅助。
- 参数量
- 32.5B
- 上下文
- 131072
- 建议显存
- BF16:80;INT4单用户:24;INT8或服务化:48
AI模型
面向代码生成、补全、解释和修复的7B模型,适合个人设备和私有代码助手原型。
- 参数量
- 7.6B
- 上下文
- 131072
- 建议显存
- INT4推理:8;BF16或长上下文:24
AI模型
支持图像、文档和视频理解的7B视觉语言模型,适合OCR、图表与多模态问答。
- 参数量
- 7B
- 上下文
- 131072
- 建议显存
- 基础推理:16;高分辨率或视频:24
AI模型
能力、速度和显存成本较均衡的中文通用模型,适合RAG、知识问答、代码和智能体。
- 参数量
- 14.8B
- 上下文
- 131072
- 建议显存
- BF16:40;INT4服务:16;INT8或长上下文:24
AI模型
235B总参数、22B激活参数的MoE模型,面向高质量推理、代码和企业级服务。
- 参数量
- 235B
- 上下文
- 131072
- 建议显存
- FP8:320;BF16:640;INT4:160
AI模型
32.8B级通用模型,能力与本地部署成本较平衡,适合高质量中文问答、代码和智能体。
- 参数量
- 32.8B
- 上下文
- 131072
- 建议显存
- BF16:80;INT4单用户:24;INT8或高并发:48
AI模型
8.2B级通用大模型,适合本地问答、RAG、工具调用和中英文应用开发。
- 参数量
- 8.2B
- 上下文
- 131072
- 建议显存
- 基础推理:12;长上下文或并发:24
AI模型
OpenAI发布的多语言语音识别模型,适合转写、字幕和语音内容处理。
- 参数量
- 1.55B
- 上下文
- —
- 建议显存
- 高并发:16;批量转写:8
AI模型
零一万物发布的34B中英双语模型,适合高质量问答、RAG和中文内容处理。
- 参数量
- 34B
- 上下文
- 32768
- 建议显存
- BF16:80;INT8:48;INT4单用户:24
软件与框架
NVIDIA GPU通用并行计算平台,是PyTorch、TensorRT及大量AI算子的基础依赖。
- 类型
- GPU计算平台
- 维护方
- NVIDIA
- 支持硬件
- NVIDIA GPU
软件与框架
微软开源的深度学习训练优化库,覆盖ZeRO、并行训练、混合精度和大模型推理。
- 类型
- 分布式训练框架
- 维护方
- Microsoft
- 支持硬件
- NVIDIA GPU、AMD GPU(支持范围需核对)
软件与框架
容器镜像与运行时工具,是固定AI应用依赖、交付GPU服务和复现实验环境的基础设施。
- 类型
- 容器平台
- 维护方
- Docker
- 支持硬件
- CPU、通过NVIDIA Container Toolkit等使用GPU
软件与框架
覆盖文本、视觉、语音和多模态任务的模型加载、训练与推理基础库。
- 类型
- 模型开发库
- 维护方
- Hugging Face
- 支持硬件
- NVIDIA GPU、AMD GPU、CPU、Apple Silicon及其他后端
软件与框架
基于Kubernetes的模型推理平台,提供服务编排、弹性伸缩、流量管理和多种模型运行时。
- 类型
- 云原生模型服务平台
- 维护方
- KServe Community
- 支持硬件
- Kubernetes节点可用的CPU与GPU
软件与框架
容器编排平台,可用于GPU调度、模型服务部署、弹性扩缩和集群资源管理。
- 类型
- 容器编排平台
- 维护方
- Cloud Native Computing Foundation
- 支持硬件
- CPU、通过设备插件使用GPU和加速器
软件与框架
NVIDIA多GPU和多节点集合通信库,是分布式训练及张量并行的重要底层组件。
- 类型
- GPU通信库
- 维护方
- NVIDIA
- 支持硬件
- NVIDIA GPU、NVLink、InfiniBand、RoCE、以太网
软件与框架
NVIDIA GPU宿主驱动,决定硬件识别、CUDA运行时上限和容器访问GPU的基础能力。
- 类型
- GPU驱动
- 维护方
- NVIDIA
- 支持硬件
- NVIDIA GPU
软件与框架
跨平台模型推理运行时,支持CPU、CUDA、TensorRT、DirectML等执行提供程序。
- 类型
- 跨平台推理运行时
- 维护方
- Microsoft
- 支持硬件
- CPU、NVIDIA GPU、AMD GPU、Windows GPU及多种加速器
软件与框架
面向本地模型下载、运行与API调用的易用工具,适合快速验证和个人应用。
- 类型
- 本地模型运行工具
- 维护方
- Ollama
- 支持硬件
- CPU、NVIDIA GPU、AMD GPU、Apple Silicon
软件与框架
开源消息传递接口实现,常用于HPC和部分多节点AI训练启动与通信。
- 类型
- 分布式通信运行时
- 维护方
- Open MPI Project
- 支持硬件
- CPU集群、InfiniBand、RoCE、以太网
软件与框架
主流深度学习框架,覆盖模型训练、推理、分布式计算与丰富的AI生态。
- 类型
- 深度学习框架
- 维护方
- PyTorch Foundation
- 支持硬件
- NVIDIA CUDA、AMD ROCm、CPU、Apple MPS及其他后端
软件与框架
AMD面向GPU计算、机器学习和HPC的开放软件栈,覆盖HIP、通信库、数学库与框架适配。
- 类型
- GPU计算平台
- 维护方
- AMD
- 支持硬件
- AMD Instinct、部分Radeon PRO与Radeon GPU
软件与框架
Ray生态中的可扩展在线推理框架,支持Python组合、多模型流水线和分布式副本。
- 类型
- 分布式模型服务框架
- 维护方
- Anyscale / Ray Project
- 支持硬件
- CPU、NVIDIA GPU及Ray支持资源
软件与框架
面向大模型和多模态模型的高性能服务框架,提供推理运行时、结构化生成和服务接口。
- 类型
- 大模型推理框架
- 维护方
- SGLang Project
- 支持硬件
- NVIDIA CUDA、AMD ROCm及文档列出的其他后端
软件与框架
覆盖模型训练、推理、分布式计算和生产部署的深度学习框架。
- 类型
- 深度学习框架
- 维护方
- Google
- 支持硬件
- CPU、NVIDIA GPU、TPU及其他插件后端
软件与框架
NVIDIA面向深度学习推理的优化SDK,适合在支持的GPU上构建低延迟、高吞吐引擎。
- 类型
- 推理优化SDK
- 维护方
- NVIDIA
- 支持硬件
- NVIDIA GPU
软件与框架
NVIDIA面向大语言模型的推理优化与服务组件,支持量化、张量并行和高性能内核。
- 类型
- 大模型推理框架
- 维护方
- NVIDIA
- 支持硬件
- NVIDIA GPU
软件与框架
NVIDIA开源推理服务器,统一托管TensorRT、ONNX Runtime、PyTorch及自定义后端模型。
- 类型
- 模型服务平台
- 维护方
- NVIDIA
- 支持硬件
- NVIDIA GPU、CPU及后端支持设备
软件与框架
NVIDIA为深度神经网络提供的GPU加速库,被PyTorch、TensorFlow等框架作为底层依赖。
- 类型
- 深度学习加速库
- 维护方
- NVIDIA
- 支持硬件
- NVIDIA GPU
软件与框架
以C/C++实现的轻量大模型推理项目,适合GGUF量化、CPU和消费级设备本地部署。
- 类型
- 轻量本地推理
- 维护方
- ggml-org
- 支持硬件
- CPU、NVIDIA GPU、AMD GPU、Apple Silicon、多种异构后端
软件与框架
面向大语言模型的高吞吐推理与OpenAI兼容服务框架,支持连续批处理和PagedAttention。
- 类型
- 大模型推理框架
- 维护方
- vLLM Project
- 支持硬件
- NVIDIA CUDA、AMD ROCm、部分Intel与其他后端