AI COMPUTE SELECTION

找到适合你的GPU、模型和部署方案

从真实需求出发,查询硬件与模型、理解兼容关系,并进入决策工具形成可保存的配置方案。

START WITH A QUESTION

先告诉我们,你要解决什么问题?

不需要先理解所有技术参数,从你的设备或目标模型开始。

WHAT YOU CAN FIND

从一个对象,连接完整的算力决策信息

SELECTION CATALOG

AI模型

当前收录 32 条资料,可按关键词、厂商、显存和使用场景缩小范围。

32条匹配资料
横向比较

选择 2–3 个同类条目,对照核心规格和适用场景。

AI模型

Baichuan2-13B-Chat

百川智能发布的13B中英双语对话模型,适合中文问答、研究和存量私有化项目。

参数量
13B
上下文
4096
建议显存
BF16:32;INT4推理:12
AI模型

DeepSeek-Coder-V2-Lite-Instruct

16B总参数、约2.4B激活参数的MoE代码模型,适合本地代码生成和多语言编程任务。

参数量
16B
上下文
131072
建议显存
INT4推理:12;BF16或长上下文:40
AI模型

DeepSeek-R1

面向复杂推理的MoE模型;完整版本部署门槛高,通常使用API或蒸馏版本。

参数量
671B
上下文
131072
建议显存
完整模型:1400;蒸馏版本:24
AI模型

DeepSeek-R1-Distill-Qwen-32B

将DeepSeek-R1推理能力蒸馏到Qwen 32B底座,适合本地数学、代码与复杂推理。

参数量
32.8B
上下文
131072
建议显存
BF16:80;INT4单用户:24;INT8或长上下文:48
AI模型

DeepSeek-R1-Distill-Qwen-7B

将DeepSeek-R1推理能力蒸馏到Qwen 7B底座,适合个人设备上的推理实验和教学。

参数量
7.6B
上下文
131072
建议显存
INT4推理:8;长上下文或BF16:24
AI模型

DeepSeek-V3

671B总参数、37B激活参数的MoE基础模型,面向高质量通用与代码任务。

参数量
671B
上下文
131072
建议显存
完整模型:1400
AI模型

GLM-4-9B

智谱开源的中英双语9B模型,支持长上下文、工具调用和本地应用开发。

参数量
9B
上下文
131072
建议显存
INT4推理:12;BF16或长上下文:24
AI模型

Gemma 2 27B

Google开放权重的27B文本模型,适合单机高质量问答、研究和私有化推理。

参数量
27B
上下文
8192
建议显存
BF16:64;INT4推理:24
AI模型

Gemma 2 9B

Google开放权重的9B文本模型,适合本地问答、研究和资源有限的应用。

参数量
9B
上下文
8192
建议显存
BF16:24;INT4推理:12
AI模型

Gemma 3 27B

Google开放权重多模态模型,支持文本和图像输入,适合单机多模态应用。

参数量
27B
上下文
131072
建议显存
BF16:64;INT4推理:24
AI模型

InternLM2.5-7B-Chat

上海AI实验室发布的中英双语7B对话模型,适合工具调用、RAG和本地研究。

参数量
7B
上下文
32768
建议显存
INT4推理:8;BF16或长上下文:20
AI模型

InternVL2.5-8B

面向图像、文档和多模态问答的8B视觉语言模型,适合OCR后处理和图表理解。

参数量
8B
上下文
32768
建议显存
基础推理:16;高分辨率多图:24
AI模型

Llama 3.1 70B

70B级通用开放权重模型,适合高质量问答、RAG和企业私有化服务。

参数量
70B
上下文
131072
建议显存
BF16:160;INT8:96;INT4低并发:48
AI模型

Llama 3.1 8B

生态成熟的8B开放权重模型,适合本地实验、英文应用、微调和端侧原型。

参数量
8B
上下文
131072
建议显存
基础推理:12;长上下文或微调:24
AI模型

Llama 3.2 3B Instruct

轻量级开放权重文本模型,适合端侧原型、摘要、分类和资源有限的本地应用。

参数量
3B
上下文
131072
建议显存
INT4推理:4;BF16或长上下文:12
AI模型

Llama 3.3 70B

面向高质量文本任务的70B指令模型,生态成熟,适合企业RAG和私有化服务。

参数量
70B
上下文
131072
建议显存
BF16:160;INT8:96;INT4低并发:48
AI模型

MiniCPM-V 2.6

面向端侧和轻量部署的多模态模型,支持图像理解、OCR和视频内容分析。

参数量
8B
上下文
32768
建议显存
量化推理:8;高分辨率或视频:16
AI模型

Mistral 7B Instruct v0.3

生态成熟的7B开放权重指令模型,适合英文应用、函数调用和资源有限的本地部署。

参数量
7.3B
上下文
32768
建议显存
BF16:20;INT4推理:8
AI模型

Mistral Small 3.1 24B

24B级多模态指令模型,适合单机高质量问答、文档理解和函数调用。

参数量
24B
上下文
131072
建议显存
BF16:64;INT4推理:20
AI模型

Mixtral 8x7B Instruct

稀疏MoE指令模型,兼顾较强能力与每Token较低激活参数,适合多卡推理和研究。

参数量
46.7B
上下文
32768
建议显存
BF16:120;INT4:32;INT8:64
AI模型

Phi-4

微软发布的14B级小型语言模型,适合推理、代码和资源有限的本地部署。

参数量
14B
上下文
16384
建议显存
INT4推理:12;BF16或微调:32
AI模型

Qwen2.5-72B-Instruct

72B级中英双语通用模型,适合企业RAG、高质量问答和私有化服务。

参数量
72.7B
上下文
131072
建议显存
BF16:160;INT8:96;INT4低并发:48
AI模型

Qwen2.5-7B-Instruct

成熟的7B级中英双语指令模型,适合本地问答、RAG、工具调用和轻量微调。

参数量
7.6B
上下文
131072
建议显存
INT4推理:8;BF16或长上下文:24
AI模型

Qwen2.5-Coder-32B

面向代码生成、补全、解释和修复的32B代码模型,适合私有代码库与开发辅助。

参数量
32.5B
上下文
131072
建议显存
BF16:80;INT4单用户:24;INT8或服务化:48
AI模型

Qwen2.5-Coder-7B-Instruct

面向代码生成、补全、解释和修复的7B模型,适合个人设备和私有代码助手原型。

参数量
7.6B
上下文
131072
建议显存
INT4推理:8;BF16或长上下文:24
AI模型

Qwen2.5-VL-7B

支持图像、文档和视频理解的7B视觉语言模型,适合OCR、图表与多模态问答。

参数量
7B
上下文
131072
建议显存
基础推理:16;高分辨率或视频:24
AI模型

Qwen3-14B

能力、速度和显存成本较均衡的中文通用模型,适合RAG、知识问答、代码和智能体。

参数量
14.8B
上下文
131072
建议显存
BF16:40;INT4服务:16;INT8或长上下文:24
AI模型

Qwen3-235B-A22B

235B总参数、22B激活参数的MoE模型,面向高质量推理、代码和企业级服务。

参数量
235B
上下文
131072
建议显存
FP8:320;BF16:640;INT4:160
AI模型

Qwen3-32B

32.8B级通用模型,能力与本地部署成本较平衡,适合高质量中文问答、代码和智能体。

参数量
32.8B
上下文
131072
建议显存
BF16:80;INT4单用户:24;INT8或高并发:48
AI模型

Qwen3-8B

8.2B级通用大模型,适合本地问答、RAG、工具调用和中英文应用开发。

参数量
8.2B
上下文
131072
建议显存
基础推理:12;长上下文或并发:24
AI模型

Whisper Large V3

OpenAI发布的多语言语音识别模型,适合转写、字幕和语音内容处理。

参数量
1.55B
上下文
建议显存
高并发:16;批量转写:8
AI模型

Yi-1.5-34B-Chat

零一万物发布的34B中英双语模型,适合高质量问答、RAG和中文内容处理。

参数量
34B
上下文
32768
建议显存
BF16:80;INT8:48;INT4单用户:24
FROM DATA TO DECISION

完成对比后,继续验证配置

候选产品对比只能缩小范围。使用显存估算、GPU适配和服务器配置工具,继续核对模型规模、并发、主板平台、供电与散热。

进入AI算力决策工具 →