集群运维与排障cluster-operationsPyTorch CUDA环境安装与验证:驱动、运行时和框架逐层排查
依据官方资料整理PyTorch CUDA环境安装与验证:驱动、运行时和框架逐层排查的完整操作流程,包含环境检查、启动命令、参数说明、验收方法、故障排查和生产边界。
一次检索资讯、教程、文档、案例、GPU、模型、软件与决策工具。
64GB HBM2e的PCIe数据中心加速器,适合ROCm开发、HPC和单卡大容量实验。
查看详情 →GPU / 算力卡128GB HBM2e的CDNA 2双Die加速器,适合ROCm HPC、科学计算和存量训练平台。
查看详情 →GPU / 算力卡192GB HBM3的CDNA 3数据中心加速器,适合大模型训练、推理和高带宽HPC。
查看详情 →GPU / 算力卡256GB HBM3e的大容量数据中心加速器,适合超大模型推理和内存密集型AI任务。
查看详情 →GPU / 算力卡32GB ECC专业工作站GPU,适合ROCm开发、视觉工作和中型模型本地推理。
查看详情 →GPU / 算力卡48GB专业工作站GPU,适合ROCm开发、可视化和容量优先的单机模型实验。
查看详情 →GPU / 算力卡24GB显存的RDNA 3消费级GPU,适合愿意验证ROCm兼容性的本地模型与图像生成用户。
查看详情 →GPU / 算力卡24GB显存的成熟消费级GPU,二手市场常见,适合本地模型推理、图像生成和个人研究。
查看详情 →GPU / 算力卡16GB显存的Ada消费级GPU,适合7B至14B模型、图像生成和个人AI开发。
查看详情 →GPU / 算力卡16GB显存的Ada消费级GPU,功耗和性能较均衡,适合中小模型、视觉生成和桌面AI开发。
查看详情 →GPU / 算力卡24GB显存的成熟消费级AI开发卡,生态完善、性价比较高,适合个人和小型工作室。
查看详情 →GPU / 算力卡16GB显存的Blackwell消费级GPU,适合本地中小模型、图像生成和AI开发,但容量边界比算力更早出现。
查看详情 →GPU / 算力卡面向本地大模型、生成式图像和高性能工作站的旗舰消费级GPU。32GB显存适合中型量化模型,但无多卡NVLink。
查看详情 →GPU / 算力卡16GB显存的Intel消费级GPU,可用于OpenVINO、oneAPI和部分本地模型推理实验。
查看详情 →GPU / 算力卡96GB HBM2e的训练与推理加速器,使用SynapseAI软件栈和RoCE横向互联。
查看详情 →GPU / 算力卡128GB HBM2e的训练与推理加速器,面向大模型多卡和以太网扩展集群。
查看详情 →GPU / 算力卡24GB ECC显存的低功耗数据中心GPU,兼顾AI推理、图形和虚拟工作站。
查看详情 →GPU / 算力卡成熟的Ampere数据中心GPU,支持HBM2e、NVLink和MIG,适合存量训练集群与稳定生产环境。
查看详情 →GPU / 算力卡24GB HBM2数据中心GPU,支持MIG与NVLink,适合推理、训练和HPC混合负载。
查看详情 →GPU / 算力卡48GB ECC显存的Ampere数据中心PCIe GPU,兼顾视觉、虚拟工作站和中型模型推理。
查看详情 →GPU / 算力卡180GB HBM3e的Blackwell数据中心GPU,面向大模型训练、推理和高密度HGX/DGX平台。
查看详情 →GPU / 算力卡面向数据中心训练和推理的Hopper加速器,具备HBM3、NVLink、MIG与企业级RAS能力。
查看详情 →GPU / 算力卡141GB HBM3e数据中心GPU,重点提升大模型推理所需的显存容量和带宽。
查看详情 →GPU / 算力卡24GB低功耗数据中心GPU,面向视频、视觉和生成式AI推理,适合高密度PCIe服务器。
查看详情 →
集群运维与排障cluster-operations依据官方资料整理PyTorch CUDA环境安装与验证:驱动、运行时和框架逐层排查的完整操作流程,包含环境检查、启动命令、参数说明、验收方法、故障排查和生产边界。
芯片与硬件GPUFrontier model pre-training has converged on mixture of experts (MoE), which is fundamentally changing what limits large-scale AI training. As compute per token...
芯片与硬件GPUThe demand for AI continues to accelerate. Workloads are getting larger, models are becoming more complex, and there is mounting pressure to deploy AI compute...
开发框架与软件生态训练近日,由中国光华科技基金会青年开源专项基金公益支持,沐曦股份联合AI Infra 开源社区、TileAI 社区、GitLink平台、启悟学习社区、联合DataWhale等多家头部AI开源相关平台和社区,共同推出的 TileLang Puzzle 开源训练营,已圆满完成线上教学阶段 。作为业界第一个系统性讲授 TileLang 算子开发与优化的实战型开源课程,本次训练营成功吸引了全国 551 名开发者参与,在国产 AI 底层人才培养领域取
大模型与智能体摩尔线程作为国内领先的国产全功能GPU企业, 摩尔线程深度参与大会 , 多位技术专家在多个论坛及Open Talk环节发表演讲 ,系统呈现覆盖“云-边-端”的软硬协同全栈创新成果:▼ 在大模型产业论坛, 摩尔线程带来《面向大模型时代的智能计算:万卡集群大模型训练实践》主题演讲。▼ 在智算前沿-AI赋能系统论坛, 摩尔线程带来《TiLISA& MTX:打造支撑多DSL的编译后端》技术分享。
模型与AI研究报告LLMQ论文给出面向消费级GPU的CUDA/C++低精度大模型训练实现,讨论激活检查点、卸载、通信和显存受限条件下3B至32B模型的训练设计。
大模型与智能体DeepSeekDeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价作为迈向新一代架构的中间步骤,V3.2-Exp 在 V3.1-Terminus 的基础上引入了 DeepSeek Sparse Attention(一种稀疏注意力机制),针对长文本的训练和推理效率进行了探索性的优化和验证。目前,官方 App、网页端、小程序均已同步更新为 DeepSeek-V3.2-Exp,同时 API 大幅度降价 ,欢迎广大用户体验测试并向我们反馈