AI COMPUTE SELECTION

找到适合你的GPU、模型和部署方案

从真实需求出发,查询硬件与模型、理解兼容关系,并进入决策工具形成可保存的配置方案。

START WITH A QUESTION

先告诉我们,你要解决什么问题?

不需要先理解所有技术参数,从你的设备或目标模型开始。

WHAT YOU CAN FIND

从一个对象,连接完整的算力决策信息

SELECTION CATALOG

全部选型资料

当前收录 84 条资料,可按关键词、厂商、显存和使用场景缩小范围。

84条匹配资料
横向比较

选择 2–3 个同类条目,对照核心规格和适用场景。

GPU显卡64GB

AMD Instinct MI210

64GB HBM2e的PCIe数据中心加速器,适合ROCm开发、HPC和单卡大容量实验。

显存
64 GB
功耗
300 W
带宽
1.6 TB/s
GPU显卡128GB

AMD Instinct MI250X

128GB HBM2e的CDNA 2双Die加速器,适合ROCm HPC、科学计算和存量训练平台。

显存
128 GB
功耗
560 W
带宽
3.2 TB/s
GPU显卡192GB

AMD Instinct MI300X

192GB HBM3的CDNA 3数据中心加速器,适合大模型训练、推理和高带宽HPC。

显存
192 GB
功耗
750 W
带宽
5.3 TB/s
GPU显卡256GB

AMD Instinct MI325X

256GB HBM3e的大容量数据中心加速器,适合超大模型推理和内存密集型AI任务。

显存
256 GB
功耗
带宽
6 TB/s
GPU显卡32GB

AMD Radeon PRO W7800

32GB ECC专业工作站GPU,适合ROCm开发、视觉工作和中型模型本地推理。

显存
32 GB
功耗
260 W
带宽
0.576 TB/s
GPU显卡48GB

AMD Radeon PRO W7900

48GB专业工作站GPU,适合ROCm开发、可视化和容量优先的单机模型实验。

显存
48 GB
功耗
295 W
带宽
0.864 TB/s
GPU显卡24GB

AMD Radeon RX 7900 XTX

24GB显存的RDNA 3消费级GPU,适合愿意验证ROCm兼容性的本地模型与图像生成用户。

显存
24 GB
功耗
355 W
带宽
0.96 TB/s
GPU显卡24GB

GeForce RTX 3090

24GB显存的成熟消费级GPU,二手市场常见,适合本地模型推理、图像生成和个人研究。

显存
24 GB
功耗
350 W
带宽
0.936 TB/s
GPU显卡16GB

GeForce RTX 4080 SUPER

16GB显存的Ada消费级GPU,功耗和性能较均衡,适合中小模型、视觉生成和桌面AI开发。

显存
16 GB
功耗
320 W
带宽
0.736 TB/s
GPU显卡24GB

GeForce RTX 4090

24GB显存的成熟消费级AI开发卡,生态完善、性价比较高,适合个人和小型工作室。

显存
24 GB
功耗
450 W
带宽
1.008 TB/s
GPU显卡16GB

GeForce RTX 5080

16GB显存的Blackwell消费级GPU,适合本地中小模型、图像生成和AI开发,但容量边界比算力更早出现。

显存
16 GB
功耗
360 W
带宽
GPU显卡32GB

GeForce RTX 5090

面向本地大模型、生成式图像和高性能工作站的旗舰消费级GPU。32GB显存适合中型量化模型,但无多卡NVLink。

显存
32 GB
功耗
575 W
带宽
1.792 TB/s
GPU显卡16GB

Intel Arc A770 16GB

16GB显存的Intel消费级GPU,可用于OpenVINO、oneAPI和部分本地模型推理实验。

显存
16 GB
功耗
225 W
带宽
0.56 TB/s
GPU显卡96GB

Intel Gaudi2

96GB HBM2e的训练与推理加速器,使用SynapseAI软件栈和RoCE横向互联。

显存
96 GB
功耗
600 W
带宽
2.45 TB/s
GPU显卡128GB

Intel Gaudi3

128GB HBM2e的训练与推理加速器,面向大模型多卡和以太网扩展集群。

显存
128 GB
功耗
900 W
带宽
3.7 TB/s
GPU显卡24GB

NVIDIA A10

24GB ECC显存的低功耗数据中心GPU,兼顾AI推理、图形和虚拟工作站。

显存
24 GB
功耗
150 W
带宽
0.6 TB/s
GPU显卡80GB

NVIDIA A100 80GB

成熟的Ampere数据中心GPU,支持HBM2e、NVLink和MIG,适合存量训练集群与稳定生产环境。

显存
80 GB
功耗
400 W
带宽
2.039 TB/s
GPU显卡24GB

NVIDIA A30

24GB HBM2数据中心GPU,支持MIG与NVLink,适合推理、训练和HPC混合负载。

显存
24 GB
功耗
165 W
带宽
0.933 TB/s
GPU显卡48GB

NVIDIA A40

48GB ECC显存的Ampere数据中心PCIe GPU,兼顾视觉、虚拟工作站和中型模型推理。

显存
48 GB
功耗
300 W
带宽
0.696 TB/s
GPU显卡180GB

NVIDIA B200

180GB HBM3e的Blackwell数据中心GPU,面向大模型训练、推理和高密度HGX/DGX平台。

显存
180 GB
功耗
1000 W
带宽
8 TB/s
GPU显卡80GB

NVIDIA H100 SXM

面向数据中心训练和推理的Hopper加速器,具备HBM3、NVLink、MIG与企业级RAS能力。

显存
80 GB
功耗
700 W
带宽
3.35 TB/s
GPU显卡141GB

NVIDIA H200 SXM

141GB HBM3e数据中心GPU,重点提升大模型推理所需的显存容量和带宽。

显存
141 GB
功耗
700 W
带宽
4.8 TB/s
GPU显卡24GB

NVIDIA L4

24GB低功耗数据中心GPU,面向视频、视觉和生成式AI推理,适合高密度PCIe服务器。

显存
24 GB
功耗
72 W
带宽
0.3 TB/s
GPU显卡48GB

NVIDIA L40S

48GB ECC显存的PCIe数据中心GPU,兼顾生成式AI推理、训练、图形和视频工作负载。

显存
48 GB
功耗
350 W
带宽
0.864 TB/s
GPU显卡48GB

NVIDIA RTX A6000

48GB ECC显存的Ampere专业工作站GPU,支持NVLink,适合大显存开发和专业可视化。

显存
48 GB
功耗
300 W
带宽
0.768 TB/s
GPU显卡16GB

NVIDIA T4

16GB低功耗Turing数据中心GPU,生态成熟,适合存量推理、视频和轻量AI服务。

显存
16 GB
功耗
70 W
带宽
0.32 TB/s
GPU显卡32GB

NVIDIA V100 32GB SXM2

32GB HBM2的Volta数据中心GPU,仍常见于存量训练集群和云资源。

显存
32 GB
功耗
300 W
带宽
0.9 TB/s
GPU显卡48GB

RTX 6000 Ada

48GB ECC显存的专业工作站GPU,功耗相对温和,适合稳定的模型开发、推理和专业可视化。

显存
48 GB
功耗
300 W
带宽
0.96 TB/s
GPU显卡96GB

RTX PRO 6000 Blackwell

96GB ECC显存的专业工作站GPU,适合大模型开发、专业可视化和需要认证驱动的持续负载。

显存
96 GB
功耗
600 W
带宽
AI模型

Baichuan2-13B-Chat

百川智能发布的13B中英双语对话模型,适合中文问答、研究和存量私有化项目。

参数量
13B
上下文
4096
建议显存
BF16:32;INT4推理:12
AI模型

DeepSeek-Coder-V2-Lite-Instruct

16B总参数、约2.4B激活参数的MoE代码模型,适合本地代码生成和多语言编程任务。

参数量
16B
上下文
131072
建议显存
INT4推理:12;BF16或长上下文:40
AI模型

DeepSeek-R1

面向复杂推理的MoE模型;完整版本部署门槛高,通常使用API或蒸馏版本。

参数量
671B
上下文
131072
建议显存
完整模型:1400;蒸馏版本:24
AI模型

DeepSeek-R1-Distill-Qwen-32B

将DeepSeek-R1推理能力蒸馏到Qwen 32B底座,适合本地数学、代码与复杂推理。

参数量
32.8B
上下文
131072
建议显存
BF16:80;INT4单用户:24;INT8或长上下文:48
AI模型

DeepSeek-R1-Distill-Qwen-7B

将DeepSeek-R1推理能力蒸馏到Qwen 7B底座,适合个人设备上的推理实验和教学。

参数量
7.6B
上下文
131072
建议显存
INT4推理:8;长上下文或BF16:24
AI模型

DeepSeek-V3

671B总参数、37B激活参数的MoE基础模型,面向高质量通用与代码任务。

参数量
671B
上下文
131072
建议显存
完整模型:1400
AI模型

GLM-4-9B

智谱开源的中英双语9B模型,支持长上下文、工具调用和本地应用开发。

参数量
9B
上下文
131072
建议显存
INT4推理:12;BF16或长上下文:24
AI模型

Gemma 2 27B

Google开放权重的27B文本模型,适合单机高质量问答、研究和私有化推理。

参数量
27B
上下文
8192
建议显存
BF16:64;INT4推理:24
AI模型

Gemma 2 9B

Google开放权重的9B文本模型,适合本地问答、研究和资源有限的应用。

参数量
9B
上下文
8192
建议显存
BF16:24;INT4推理:12
AI模型

Gemma 3 27B

Google开放权重多模态模型,支持文本和图像输入,适合单机多模态应用。

参数量
27B
上下文
131072
建议显存
BF16:64;INT4推理:24
AI模型

InternLM2.5-7B-Chat

上海AI实验室发布的中英双语7B对话模型,适合工具调用、RAG和本地研究。

参数量
7B
上下文
32768
建议显存
INT4推理:8;BF16或长上下文:20
AI模型

InternVL2.5-8B

面向图像、文档和多模态问答的8B视觉语言模型,适合OCR后处理和图表理解。

参数量
8B
上下文
32768
建议显存
基础推理:16;高分辨率多图:24
AI模型

Llama 3.1 70B

70B级通用开放权重模型,适合高质量问答、RAG和企业私有化服务。

参数量
70B
上下文
131072
建议显存
BF16:160;INT8:96;INT4低并发:48
AI模型

Llama 3.1 8B

生态成熟的8B开放权重模型,适合本地实验、英文应用、微调和端侧原型。

参数量
8B
上下文
131072
建议显存
基础推理:12;长上下文或微调:24
AI模型

Llama 3.2 3B Instruct

轻量级开放权重文本模型,适合端侧原型、摘要、分类和资源有限的本地应用。

参数量
3B
上下文
131072
建议显存
INT4推理:4;BF16或长上下文:12
AI模型

Llama 3.3 70B

面向高质量文本任务的70B指令模型,生态成熟,适合企业RAG和私有化服务。

参数量
70B
上下文
131072
建议显存
BF16:160;INT8:96;INT4低并发:48
AI模型

MiniCPM-V 2.6

面向端侧和轻量部署的多模态模型,支持图像理解、OCR和视频内容分析。

参数量
8B
上下文
32768
建议显存
量化推理:8;高分辨率或视频:16
AI模型

Mistral 7B Instruct v0.3

生态成熟的7B开放权重指令模型,适合英文应用、函数调用和资源有限的本地部署。

参数量
7.3B
上下文
32768
建议显存
BF16:20;INT4推理:8
AI模型

Mistral Small 3.1 24B

24B级多模态指令模型,适合单机高质量问答、文档理解和函数调用。

参数量
24B
上下文
131072
建议显存
BF16:64;INT4推理:20
AI模型

Mixtral 8x7B Instruct

稀疏MoE指令模型,兼顾较强能力与每Token较低激活参数,适合多卡推理和研究。

参数量
46.7B
上下文
32768
建议显存
BF16:120;INT4:32;INT8:64
AI模型

Phi-4

微软发布的14B级小型语言模型,适合推理、代码和资源有限的本地部署。

参数量
14B
上下文
16384
建议显存
INT4推理:12;BF16或微调:32
AI模型

Qwen2.5-72B-Instruct

72B级中英双语通用模型,适合企业RAG、高质量问答和私有化服务。

参数量
72.7B
上下文
131072
建议显存
BF16:160;INT8:96;INT4低并发:48
AI模型

Qwen2.5-7B-Instruct

成熟的7B级中英双语指令模型,适合本地问答、RAG、工具调用和轻量微调。

参数量
7.6B
上下文
131072
建议显存
INT4推理:8;BF16或长上下文:24
AI模型

Qwen2.5-Coder-32B

面向代码生成、补全、解释和修复的32B代码模型,适合私有代码库与开发辅助。

参数量
32.5B
上下文
131072
建议显存
BF16:80;INT4单用户:24;INT8或服务化:48
AI模型

Qwen2.5-Coder-7B-Instruct

面向代码生成、补全、解释和修复的7B模型,适合个人设备和私有代码助手原型。

参数量
7.6B
上下文
131072
建议显存
INT4推理:8;BF16或长上下文:24
AI模型

Qwen2.5-VL-7B

支持图像、文档和视频理解的7B视觉语言模型,适合OCR、图表与多模态问答。

参数量
7B
上下文
131072
建议显存
基础推理:16;高分辨率或视频:24
AI模型

Qwen3-14B

能力、速度和显存成本较均衡的中文通用模型,适合RAG、知识问答、代码和智能体。

参数量
14.8B
上下文
131072
建议显存
BF16:40;INT4服务:16;INT8或长上下文:24
AI模型

Qwen3-235B-A22B

235B总参数、22B激活参数的MoE模型,面向高质量推理、代码和企业级服务。

参数量
235B
上下文
131072
建议显存
FP8:320;BF16:640;INT4:160
AI模型

Qwen3-32B

32.8B级通用模型,能力与本地部署成本较平衡,适合高质量中文问答、代码和智能体。

参数量
32.8B
上下文
131072
建议显存
BF16:80;INT4单用户:24;INT8或高并发:48
AI模型

Qwen3-8B

8.2B级通用大模型,适合本地问答、RAG、工具调用和中英文应用开发。

参数量
8.2B
上下文
131072
建议显存
基础推理:12;长上下文或并发:24
AI模型

Whisper Large V3

OpenAI发布的多语言语音识别模型,适合转写、字幕和语音内容处理。

参数量
1.55B
上下文
建议显存
高并发:16;批量转写:8
AI模型

Yi-1.5-34B-Chat

零一万物发布的34B中英双语模型,适合高质量问答、RAG和中文内容处理。

参数量
34B
上下文
32768
建议显存
BF16:80;INT8:48;INT4单用户:24
软件与框架

CUDA

NVIDIA GPU通用并行计算平台,是PyTorch、TensorRT及大量AI算子的基础依赖。

类型
GPU计算平台
维护方
NVIDIA
支持硬件
NVIDIA GPU
软件与框架

DeepSpeed

微软开源的深度学习训练优化库,覆盖ZeRO、并行训练、混合精度和大模型推理。

类型
分布式训练框架
维护方
Microsoft
支持硬件
NVIDIA GPU、AMD GPU(支持范围需核对)
软件与框架

Docker

容器镜像与运行时工具,是固定AI应用依赖、交付GPU服务和复现实验环境的基础设施。

类型
容器平台
维护方
Docker
支持硬件
CPU、通过NVIDIA Container Toolkit等使用GPU
软件与框架

Hugging Face Transformers

覆盖文本、视觉、语音和多模态任务的模型加载、训练与推理基础库。

类型
模型开发库
维护方
Hugging Face
支持硬件
NVIDIA GPU、AMD GPU、CPU、Apple Silicon及其他后端
软件与框架

KServe

基于Kubernetes的模型推理平台,提供服务编排、弹性伸缩、流量管理和多种模型运行时。

类型
云原生模型服务平台
维护方
KServe Community
支持硬件
Kubernetes节点可用的CPU与GPU
软件与框架

Kubernetes

容器编排平台,可用于GPU调度、模型服务部署、弹性扩缩和集群资源管理。

类型
容器编排平台
维护方
Cloud Native Computing Foundation
支持硬件
CPU、通过设备插件使用GPU和加速器
软件与框架

NCCL

NVIDIA多GPU和多节点集合通信库,是分布式训练及张量并行的重要底层组件。

类型
GPU通信库
维护方
NVIDIA
支持硬件
NVIDIA GPU、NVLink、InfiniBand、RoCE、以太网
软件与框架

NVIDIA Driver

NVIDIA GPU宿主驱动,决定硬件识别、CUDA运行时上限和容器访问GPU的基础能力。

类型
GPU驱动
维护方
NVIDIA
支持硬件
NVIDIA GPU
软件与框架

ONNX Runtime

跨平台模型推理运行时,支持CPU、CUDA、TensorRT、DirectML等执行提供程序。

类型
跨平台推理运行时
维护方
Microsoft
支持硬件
CPU、NVIDIA GPU、AMD GPU、Windows GPU及多种加速器
软件与框架

Ollama

面向本地模型下载、运行与API调用的易用工具,适合快速验证和个人应用。

类型
本地模型运行工具
维护方
Ollama
支持硬件
CPU、NVIDIA GPU、AMD GPU、Apple Silicon
软件与框架

OpenMPI

开源消息传递接口实现,常用于HPC和部分多节点AI训练启动与通信。

类型
分布式通信运行时
维护方
Open MPI Project
支持硬件
CPU集群、InfiniBand、RoCE、以太网
软件与框架

PyTorch

主流深度学习框架,覆盖模型训练、推理、分布式计算与丰富的AI生态。

类型
深度学习框架
维护方
PyTorch Foundation
支持硬件
NVIDIA CUDA、AMD ROCm、CPU、Apple MPS及其他后端
软件与框架

ROCm

AMD面向GPU计算、机器学习和HPC的开放软件栈,覆盖HIP、通信库、数学库与框架适配。

类型
GPU计算平台
维护方
AMD
支持硬件
AMD Instinct、部分Radeon PRO与Radeon GPU
软件与框架

Ray Serve

Ray生态中的可扩展在线推理框架,支持Python组合、多模型流水线和分布式副本。

类型
分布式模型服务框架
维护方
Anyscale / Ray Project
支持硬件
CPU、NVIDIA GPU及Ray支持资源
软件与框架

SGLang

面向大模型和多模态模型的高性能服务框架,提供推理运行时、结构化生成和服务接口。

类型
大模型推理框架
维护方
SGLang Project
支持硬件
NVIDIA CUDA、AMD ROCm及文档列出的其他后端
软件与框架

TensorFlow

覆盖模型训练、推理、分布式计算和生产部署的深度学习框架。

类型
深度学习框架
维护方
Google
支持硬件
CPU、NVIDIA GPU、TPU及其他插件后端
软件与框架

TensorRT

NVIDIA面向深度学习推理的优化SDK,适合在支持的GPU上构建低延迟、高吞吐引擎。

类型
推理优化SDK
维护方
NVIDIA
支持硬件
NVIDIA GPU
软件与框架

TensorRT-LLM

NVIDIA面向大语言模型的推理优化与服务组件,支持量化、张量并行和高性能内核。

类型
大模型推理框架
维护方
NVIDIA
支持硬件
NVIDIA GPU
软件与框架

Triton Inference Server

NVIDIA开源推理服务器,统一托管TensorRT、ONNX Runtime、PyTorch及自定义后端模型。

类型
模型服务平台
维护方
NVIDIA
支持硬件
NVIDIA GPU、CPU及后端支持设备
软件与框架

cuDNN

NVIDIA为深度神经网络提供的GPU加速库,被PyTorch、TensorFlow等框架作为底层依赖。

类型
深度学习加速库
维护方
NVIDIA
支持硬件
NVIDIA GPU
软件与框架

llama.cpp

以C/C++实现的轻量大模型推理项目,适合GGUF量化、CPU和消费级设备本地部署。

类型
轻量本地推理
维护方
ggml-org
支持硬件
CPU、NVIDIA GPU、AMD GPU、Apple Silicon、多种异构后端
软件与框架

vLLM

面向大语言模型的高吞吐推理与OpenAI兼容服务框架,支持连续批处理和PagedAttention。

类型
大模型推理框架
维护方
vLLM Project
支持硬件
NVIDIA CUDA、AMD ROCm、部分Intel与其他后端
FROM DATA TO DECISION

完成对比后,继续验证配置

候选产品对比只能缩小范围。使用显存估算、GPU适配和服务器配置工具,继续核对模型规模、并发、主板平台、供电与散热。

进入AI算力决策工具 →