今日,MiniMax 正式开源多模态生成模型 MiniMax H3。同日,摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈, 率先完成 H3 的极速适配与高效运行 。这一成果不仅展示了 MUSA 软件生态面向前沿模型的快速响应与全栈协同能力,也彰显了全功能 GPU 驱动多模态模型创新的实践能力。
视频:H3 在单机八卡 MTT S5000 节点上的运行状态
作为 MiniMax 首款开源多模态生成模型 ,H3 突破了传统单一任务的边界,能在多模态上下文中统一理解创作意图,支持文本、图片、音频和视频的多元输入,可直出 2K 分辨率、最长 15 秒的原生音画内容。在生成表现与性价比上,H3 具备商用级多场景内容生成能力,不仅在 Artificial Analysis 视频模型榜单中斩获“视频编辑能力全球第一”,其 2K 分辨率视频生成价格更低至 0.8 元/秒,展现出极高的商业性价比。此外,H3 的开源属性显著降低了应用门槛,支持企业本地化灵活部署与自有数据定制,在满足安全合规需求的同时,加速多模态生产力的广泛普及。
MiniMax H3 开源当日,摩尔线程团队迅速完成了模型架构拆解、核心技术分析及典型算子梳理,仅用 3 小时便打通了从 SGLang-MUSA 推理框架到 MATE、muDNN 高性能算子库的完整适配路径,实现了 H3 在 MTT S5000 上的快速部署与稳定运行。
依托 MTT S5000 大算力底座,从容应对高计算负载
由于多模态上下文的引入,MiniMax H3 的序列长度方差扩大了 3 倍,理解与生成阶段的计算负载显著提升,对底层硬件的算力规格与吞吐提出了严峻挑战。MTT S5000 凭借业内领先的算力密度,从容承接 H3 在理解与生成全流程中的高计算负载,高效满足多模态上下文推理的算力需求,充分释放 H3 模型完整性能。
MATE 与 SGLang-MUSA 深度协同,全栈加速推理效能
MiniMax H3 Day-0 适配并不依赖单一算子方案,而是由多层次算子、推理框架生态共同支撑。
MUSA 在编程模型、运行时接口及主流 AI 生态接入层,具备高度生态兼容与迁移能力,可加速上游实现的识别、迁移与验证,大幅缩短新模型适配周期;自研开源算子优化引擎 MATE 负责能力检测、算子选择与后端调度,为 Attention、GEMM 等核心算子提供高效实现及统一调用接口,构建起 “SGLang-MUSA → MATE → MTCC → MUSA Runtime” 的软件闭环。
在推理框架层面,SGLang-MUSA 已于今年 4 月合入 SGLang 主线,成为官方后端矩阵一员。不论 SGLang 框架本体 sglang 、高性能算子库 sgl-kernel,还是多模态生成模型的推理子系统 SGLang-Diffusion,开发者均可原生调用摩尔线程 GPU,获得极致的性能体验。
本次 MiniMax H3 在 MTT S5000 上的极速适配,再次彰显了 MUSA 架构面向前沿模型“发布即适配”的全栈协同能力,并以“适配—部署—优化”的完整工程路径,助力开发者以更快速度与更低成本接入最新模型。
未来,摩尔线程将与 MiniMax 持续深化合作,在多模态领域共同探索更强的上下文理解能力与更大模型规模,加速 AGI 技术的创新与产业化落地。




