先告诉我们,你要解决什么问题?
不需要先理解所有技术参数,从你的设备或目标模型开始。
从一个对象,连接完整的算力决策信息
全部选型资料
当前收录 84 条资料,可按关键词、厂商、显存和使用场景缩小范围。
AMD Instinct MI210
64GB HBM2e的PCIe数据中心加速器,适合ROCm开发、HPC和单卡大容量实验。
AMD Instinct MI250X
128GB HBM2e的CDNA 2双Die加速器,适合ROCm HPC、科学计算和存量训练平台。
AMD Instinct MI300X
192GB HBM3的CDNA 3数据中心加速器,适合大模型训练、推理和高带宽HPC。
AMD Instinct MI325X
256GB HBM3e的大容量数据中心加速器,适合超大模型推理和内存密集型AI任务。
AMD Radeon PRO W7800
32GB ECC专业工作站GPU,适合ROCm开发、视觉工作和中型模型本地推理。
AMD Radeon PRO W7900
48GB专业工作站GPU,适合ROCm开发、可视化和容量优先的单机模型实验。
AMD Radeon RX 7900 XTX
24GB显存的RDNA 3消费级GPU,适合愿意验证ROCm兼容性的本地模型与图像生成用户。
GeForce RTX 3090
24GB显存的成熟消费级GPU,二手市场常见,适合本地模型推理、图像生成和个人研究。
GeForce RTX 4070 Ti SUPER
16GB显存的Ada消费级GPU,适合7B至14B模型、图像生成和个人AI开发。
GeForce RTX 4080 SUPER
16GB显存的Ada消费级GPU,功耗和性能较均衡,适合中小模型、视觉生成和桌面AI开发。
GeForce RTX 4090
24GB显存的成熟消费级AI开发卡,生态完善、性价比较高,适合个人和小型工作室。
GeForce RTX 5080
16GB显存的Blackwell消费级GPU,适合本地中小模型、图像生成和AI开发,但容量边界比算力更早出现。
GeForce RTX 5090
面向本地大模型、生成式图像和高性能工作站的旗舰消费级GPU。32GB显存适合中型量化模型,但无多卡NVLink。
Intel Arc A770 16GB
16GB显存的Intel消费级GPU,可用于OpenVINO、oneAPI和部分本地模型推理实验。
Intel Gaudi2
96GB HBM2e的训练与推理加速器,使用SynapseAI软件栈和RoCE横向互联。
Intel Gaudi3
128GB HBM2e的训练与推理加速器,面向大模型多卡和以太网扩展集群。
NVIDIA A10
24GB ECC显存的低功耗数据中心GPU,兼顾AI推理、图形和虚拟工作站。
NVIDIA A100 80GB
成熟的Ampere数据中心GPU,支持HBM2e、NVLink和MIG,适合存量训练集群与稳定生产环境。
NVIDIA A30
24GB HBM2数据中心GPU,支持MIG与NVLink,适合推理、训练和HPC混合负载。
NVIDIA A40
48GB ECC显存的Ampere数据中心PCIe GPU,兼顾视觉、虚拟工作站和中型模型推理。
NVIDIA B200
180GB HBM3e的Blackwell数据中心GPU,面向大模型训练、推理和高密度HGX/DGX平台。
NVIDIA H100 SXM
面向数据中心训练和推理的Hopper加速器,具备HBM3、NVLink、MIG与企业级RAS能力。
NVIDIA H200 SXM
141GB HBM3e数据中心GPU,重点提升大模型推理所需的显存容量和带宽。
NVIDIA L4
24GB低功耗数据中心GPU,面向视频、视觉和生成式AI推理,适合高密度PCIe服务器。
NVIDIA L40S
48GB ECC显存的PCIe数据中心GPU,兼顾生成式AI推理、训练、图形和视频工作负载。
NVIDIA RTX A6000
48GB ECC显存的Ampere专业工作站GPU,支持NVLink,适合大显存开发和专业可视化。
NVIDIA T4
16GB低功耗Turing数据中心GPU,生态成熟,适合存量推理、视频和轻量AI服务。
NVIDIA V100 32GB SXM2
32GB HBM2的Volta数据中心GPU,仍常见于存量训练集群和云资源。
RTX 6000 Ada
48GB ECC显存的专业工作站GPU,功耗相对温和,适合稳定的模型开发、推理和专业可视化。
RTX PRO 6000 Blackwell
96GB ECC显存的专业工作站GPU,适合大模型开发、专业可视化和需要认证驱动的持续负载。
Baichuan2-13B-Chat
百川智能发布的13B中英双语对话模型,适合中文问答、研究和存量私有化项目。
DeepSeek-Coder-V2-Lite-Instruct
16B总参数、约2.4B激活参数的MoE代码模型,适合本地代码生成和多语言编程任务。
DeepSeek-R1
面向复杂推理的MoE模型;完整版本部署门槛高,通常使用API或蒸馏版本。
DeepSeek-R1-Distill-Qwen-32B
将DeepSeek-R1推理能力蒸馏到Qwen 32B底座,适合本地数学、代码与复杂推理。
DeepSeek-R1-Distill-Qwen-7B
将DeepSeek-R1推理能力蒸馏到Qwen 7B底座,适合个人设备上的推理实验和教学。
DeepSeek-V3
671B总参数、37B激活参数的MoE基础模型,面向高质量通用与代码任务。
GLM-4-9B
智谱开源的中英双语9B模型,支持长上下文、工具调用和本地应用开发。
Gemma 2 27B
Google开放权重的27B文本模型,适合单机高质量问答、研究和私有化推理。
Gemma 2 9B
Google开放权重的9B文本模型,适合本地问答、研究和资源有限的应用。
Gemma 3 27B
Google开放权重多模态模型,支持文本和图像输入,适合单机多模态应用。
InternLM2.5-7B-Chat
上海AI实验室发布的中英双语7B对话模型,适合工具调用、RAG和本地研究。
InternVL2.5-8B
面向图像、文档和多模态问答的8B视觉语言模型,适合OCR后处理和图表理解。
Llama 3.1 70B
70B级通用开放权重模型,适合高质量问答、RAG和企业私有化服务。
Llama 3.1 8B
生态成熟的8B开放权重模型,适合本地实验、英文应用、微调和端侧原型。
Llama 3.2 3B Instruct
轻量级开放权重文本模型,适合端侧原型、摘要、分类和资源有限的本地应用。
Llama 3.3 70B
面向高质量文本任务的70B指令模型,生态成熟,适合企业RAG和私有化服务。
MiniCPM-V 2.6
面向端侧和轻量部署的多模态模型,支持图像理解、OCR和视频内容分析。
Mistral 7B Instruct v0.3
生态成熟的7B开放权重指令模型,适合英文应用、函数调用和资源有限的本地部署。
Mistral Small 3.1 24B
24B级多模态指令模型,适合单机高质量问答、文档理解和函数调用。
Mixtral 8x7B Instruct
稀疏MoE指令模型,兼顾较强能力与每Token较低激活参数,适合多卡推理和研究。
Phi-4
微软发布的14B级小型语言模型,适合推理、代码和资源有限的本地部署。
Qwen2.5-72B-Instruct
72B级中英双语通用模型,适合企业RAG、高质量问答和私有化服务。
Qwen2.5-7B-Instruct
成熟的7B级中英双语指令模型,适合本地问答、RAG、工具调用和轻量微调。
Qwen2.5-Coder-32B
面向代码生成、补全、解释和修复的32B代码模型,适合私有代码库与开发辅助。
Qwen2.5-Coder-7B-Instruct
面向代码生成、补全、解释和修复的7B模型,适合个人设备和私有代码助手原型。
Qwen2.5-VL-7B
支持图像、文档和视频理解的7B视觉语言模型,适合OCR、图表与多模态问答。
Qwen3-14B
能力、速度和显存成本较均衡的中文通用模型,适合RAG、知识问答、代码和智能体。
Qwen3-235B-A22B
235B总参数、22B激活参数的MoE模型,面向高质量推理、代码和企业级服务。
Qwen3-32B
32.8B级通用模型,能力与本地部署成本较平衡,适合高质量中文问答、代码和智能体。
Qwen3-8B
8.2B级通用大模型,适合本地问答、RAG、工具调用和中英文应用开发。
Whisper Large V3
OpenAI发布的多语言语音识别模型,适合转写、字幕和语音内容处理。
Yi-1.5-34B-Chat
零一万物发布的34B中英双语模型,适合高质量问答、RAG和中文内容处理。
CUDA
NVIDIA GPU通用并行计算平台,是PyTorch、TensorRT及大量AI算子的基础依赖。
DeepSpeed
微软开源的深度学习训练优化库,覆盖ZeRO、并行训练、混合精度和大模型推理。
Docker
容器镜像与运行时工具,是固定AI应用依赖、交付GPU服务和复现实验环境的基础设施。
Hugging Face Transformers
覆盖文本、视觉、语音和多模态任务的模型加载、训练与推理基础库。
KServe
基于Kubernetes的模型推理平台,提供服务编排、弹性伸缩、流量管理和多种模型运行时。
Kubernetes
容器编排平台,可用于GPU调度、模型服务部署、弹性扩缩和集群资源管理。
NCCL
NVIDIA多GPU和多节点集合通信库,是分布式训练及张量并行的重要底层组件。
NVIDIA Driver
NVIDIA GPU宿主驱动,决定硬件识别、CUDA运行时上限和容器访问GPU的基础能力。
ONNX Runtime
跨平台模型推理运行时,支持CPU、CUDA、TensorRT、DirectML等执行提供程序。
Ollama
面向本地模型下载、运行与API调用的易用工具,适合快速验证和个人应用。
OpenMPI
开源消息传递接口实现,常用于HPC和部分多节点AI训练启动与通信。
PyTorch
主流深度学习框架,覆盖模型训练、推理、分布式计算与丰富的AI生态。
ROCm
AMD面向GPU计算、机器学习和HPC的开放软件栈,覆盖HIP、通信库、数学库与框架适配。
Ray Serve
Ray生态中的可扩展在线推理框架,支持Python组合、多模型流水线和分布式副本。
SGLang
面向大模型和多模态模型的高性能服务框架,提供推理运行时、结构化生成和服务接口。
TensorFlow
覆盖模型训练、推理、分布式计算和生产部署的深度学习框架。
TensorRT
NVIDIA面向深度学习推理的优化SDK,适合在支持的GPU上构建低延迟、高吞吐引擎。
TensorRT-LLM
NVIDIA面向大语言模型的推理优化与服务组件,支持量化、张量并行和高性能内核。
Triton Inference Server
NVIDIA开源推理服务器,统一托管TensorRT、ONNX Runtime、PyTorch及自定义后端模型。
cuDNN
NVIDIA为深度神经网络提供的GPU加速库,被PyTorch、TensorFlow等框架作为底层依赖。
llama.cpp
以C/C++实现的轻量大模型推理项目,适合GGUF量化、CPU和消费级设备本地部署。
vLLM
面向大语言模型的高吞吐推理与OpenAI兼容服务框架,支持连续批处理和PagedAttention。
查完参数,下一步是形成方案
显存估算、GPU 适配和服务器配置已经可以使用。后续将继续增加产品比较、软件兼容、成本估算和方案导出。
