SITE SEARCH

搜索全站内容

一次检索资讯、教程、文档、案例、GPU、模型、软件与决策工具。

“vLLM” 的搜索结果

34 条结果

AI算力选型库

查看完整选型库 →
GPU / 算力卡

AMD Instinct MI300X

192GB HBM3的CDNA 3数据中心加速器,适合大模型训练、推理和高带宽HPC。

查看详情 →
GPU / 算力卡

AMD Instinct MI325X

256GB HBM3e的大容量数据中心加速器,适合超大模型推理和内存密集型AI任务。

查看详情 →
GPU / 算力卡

GeForce RTX 4090

24GB显存的成熟消费级AI开发卡,生态完善、性价比较高,适合个人和小型工作室。

查看详情 →
GPU / 算力卡

GeForce RTX 5090

面向本地大模型、生成式图像和高性能工作站的旗舰消费级GPU。32GB显存适合中型量化模型,但无多卡NVLink。

查看详情 →
GPU / 算力卡

NVIDIA A40

48GB ECC显存的Ampere数据中心PCIe GPU,兼顾视觉、虚拟工作站和中型模型推理。

查看详情 →
GPU / 算力卡

NVIDIA L40S

48GB ECC显存的PCIe数据中心GPU,兼顾生成式AI推理、训练、图形和视频工作负载。

查看详情 →
GPU / 算力卡

RTX 6000 Ada

48GB ECC显存的专业工作站GPU,功耗相对温和,适合稳定的模型开发、推理和专业可视化。

查看详情 →
GPU / 算力卡

RTX PRO 6000 Blackwell

96GB ECC显存的专业工作站GPU,适合大模型开发、专业可视化和需要认证驱动的持续负载。

查看详情 →
AI 模型

Baichuan2-13B-Chat

百川智能发布的13B中英双语对话模型,适合中文问答、研究和存量私有化项目。

查看详情 →
AI 模型

DeepSeek-Coder-V2-Lite-Instruct

16B总参数、约2.4B激活参数的MoE代码模型,适合本地代码生成和多语言编程任务。

查看详情 →
AI 模型

DeepSeek-R1

面向复杂推理的MoE模型;完整版本部署门槛高,通常使用API或蒸馏版本。

查看详情 →
AI 模型

DeepSeek-R1-Distill-Qwen-32B

将DeepSeek-R1推理能力蒸馏到Qwen 32B底座,适合本地数学、代码与复杂推理。

查看详情 →
AI 模型

DeepSeek-R1-Distill-Qwen-7B

将DeepSeek-R1推理能力蒸馏到Qwen 7B底座,适合个人设备上的推理实验和教学。

查看详情 →
AI 模型

DeepSeek-V3

671B总参数、37B激活参数的MoE基础模型,面向高质量通用与代码任务。

查看详情 →
AI 模型

GLM-4-9B

智谱开源的中英双语9B模型,支持长上下文、工具调用和本地应用开发。

查看详情 →
AI 模型

Gemma 2 27B

Google开放权重的27B文本模型,适合单机高质量问答、研究和私有化推理。

查看详情 →
AI 模型

Gemma 2 9B

Google开放权重的9B文本模型,适合本地问答、研究和资源有限的应用。

查看详情 →
AI 模型

Gemma 3 27B

Google开放权重多模态模型,支持文本和图像输入,适合单机多模态应用。

查看详情 →
AI 模型

InternLM2.5-7B-Chat

上海AI实验室发布的中英双语7B对话模型,适合工具调用、RAG和本地研究。

查看详情 →
AI 模型

Llama 3.1 70B

70B级通用开放权重模型,适合高质量问答、RAG和企业私有化服务。

查看详情 →
AI 模型

Llama 3.1 8B

生态成熟的8B开放权重模型,适合本地实验、英文应用、微调和端侧原型。

查看详情 →
AI 模型

Llama 3.3 70B

面向高质量文本任务的70B指令模型,生态成熟,适合企业RAG和私有化服务。

查看详情 →
AI 模型

Mistral 7B Instruct v0.3

生态成熟的7B开放权重指令模型,适合英文应用、函数调用和资源有限的本地部署。

查看详情 →
AI 模型

Mistral Small 3.1 24B

24B级多模态指令模型,适合单机高质量问答、文档理解和函数调用。

查看详情 →

资讯、教程、文档与案例

10
开发框架与软件生态沐曦
资讯 · 开发框架与软件生态

沐曦股份曦云C系列GPU率先实现腾讯混元混合专家模型 Hy3 Day 0适配

7月6日,腾讯混元研发的快慢思考融合的混合专家模型 Hy3 正式发布并开源, 沐曦股份曦云 C 系列 GPU 率先完成Day 0 全链路适配 。依托沐曦股份全栈自研 MXMACA 软件栈,企业可实现零代码快速部署,一站式解锁 Hy3 代码、智能体、超长文档全场景业务能力。曦云C系列GPU基于沐曦股份自研核心GPU IP打造,具备高能效比与高通用性,精准匹配大模型的超大规模参数处理及长上下文推理需求。

沐曦股份新闻中心4 分钟
大模型与智能体LongCat
资讯 · 大模型与智能体

沐曦股份曦云 C 系列GPU率先 Day 0 适配美团新一代万亿参数大模型 LongCat-2.0

7月6日,美团宣布正式开源新一代万亿参数大模型 LongCat-2.0。依托“自研GPU硬件+MXMACA全栈软件”的软硬一体技术优势, 沐曦股份率先完成曦云 C 系列 GPU对LongCat-2.0 Day 0 深度适配 。LongCat-2.0代表国产大模型正式迈入工业级落地新阶段,对国产通用GPU的算力吞吐、显存容量、长文本推理、多卡协同调度等能力提出了极高要求。

沐曦股份新闻中心4 分钟
大模型与智能体GLM
资讯 · 大模型与智能体

Day0适配|壁仞科技高效支持智谱旗舰模型GLM-5.2

6月16日晚,智谱正式开源新一代旗舰模型GLM-5.2,壁仞科技壁砺™166系列基于vLLM推理框架完成该模型的 “Day0”适配与调优 ,率先向广大开发者及用户提供快速部署方案,以及高效稳定的长程任务体验。根据官方介绍,GLM-5.2是智谱迄今能力最强的开源模型。凭借自研全栈多智能体编排平台 SUPACODE 以及成熟的 BIRENSUPA™ 软件栈,壁仞科技快速实现GLM-5.2模型适配与调优。

壁仞科技企业新闻2 分钟
开发框架与软件生态开源
资讯 · 开发框架与软件生态

沐曦股份重磅发布!青年开源专项基金种子计划来了!

人工智能浪潮奔涌向前,开源正是驱动AI技术创新与生态共建的核心引擎。作为国产AI算力的代表力量, 沐曦股份 联合CCF开源发展技术委员会、木兰开源社区、启悟学习社区与AI Infra开源社区,携手中国光华科技基金会青年开源基金, 正式启动“青年开源专项基金种子计划” 。有沐曦股份、CCF开源发展技术委员会等多方权威平台联合背书,入选项目不仅能拿到资金,还能获得行业资源对接与传播曝光,更有机会深度融入国产AI开源生态——这正是沐曦股份希望

沐曦股份新闻中心3 分钟
开发框架与软件生态MiniMax
资讯 · 开发框架与软件生态

Day-0 支持|摩尔线程率先完成 MiniMax M3 大模型适配

同日,摩尔线程旗舰级 AI 训推一体智算卡 MTT S5000 已完成对该模型的 Day-0 极速适配 。这是国产大模型与国产算力芯片完成适配的又一例证,也彰显了摩尔线程凭借 原生 FP8 算力底座与高效 MUSA 软件生态 ,对前沿大模型需求的即时响应与稳定支撑能力。MiniMax M3 是目前国内唯一同时具备前沿Coding & Agentic能力、超长下文与原生多模态的开源大模型,也是第一个将完整frontier能力带入开放世界的

摩尔线程新闻中心3 分钟
开发框架与软件生态壁仞科技
资讯 · 开发框架与软件生态

Day0适配丨壁仞科技高效完成阶跃星辰Step 3.7 Flash推理验证

5月29日,阶跃星辰正式发布并开源Step 3.7 Flash。凭借壁仞科技自研的全栈多智能体编排平台SUPACODE与BIRENSUPA™的协同优势,壁砺™ 166M在Step 3.7 Flash模型发布后, 基于vLLM推理框架快速完成Day0适配 ,实现高效稳定运行,为广大开发者及用户提供开箱即用、快速部署方案以及Step 3.7 Flash的“首发体验”。Step 3.7 Flash基于壁砺™ 166M完成多模态推理任务。

壁仞科技企业新闻3 分钟
开发框架与软件生态开源
资讯 · 开发框架与软件生态

坚持技术创新,开源开放,为世界提供算力新选择

【西班牙,巴塞罗那,2026年2月28日】在MWC26 巴塞罗那期间,华为首次在海外展示最新的Atlas 950 SuperPoD, TaiShan 950 SuperPoD 等多个型号超节点产品和解决方案,并强调坚持开源开放,携手产业界共建开放共赢的计算产业生态,打造坚实的算力底座,为世界提供新选择。随着 AI 技术持续迭代演进,大模型参数规模已迈入万亿级时代,智能体(Agentic AI)深度融入各行各业生产核心环节,对算力强度与时

华为新闻中心2 分钟