摩尔线程开源高性能MATE算子库 释放全功能GPU算力潜能

摩尔线程MATE(MUSA AI Tensor Engine)是面向生成式AI的开源高性能算子库,聚焦大模型训练与推理的核心计算路径,为上层模型与推理框架提供高性能、易集成、强兼容的GPU算子能力,显著降低开发者接入主流开源算子生态的工程成本。

目前,MATE已作为关键后端能力落地vLLM与SGLang等主流推理框架,为其在摩尔线程MUSA统一系统架构上的原生运行提供核心算子层支撑,加速大模型在摩尔线程全功能GPU平台上的高效部署与性能释放。

算子效率是GPU性能释放的关键

大模型竞争正从单一模型能力,进入模型、系统与算力协同优化的新阶段。随着DeepSeek、Qwen、GLM、Kimi、MiniMax等新一代模型持续演进,模型的计算模式日趋复杂:模型架构从传统Transformer拓展至多头潜在注意力(MLA)、稀疏注意力(Sparse Attention)、混合专家(MoE)等多样化设计,计算精度也向FP8、FP4等低精度方向演进,GPU承担的计算任务持续快速变化。

对大模型训练和推理而言,GPU性能并不只取决于硬件峰值算力,核心算子的实际执行效率,以及算子与模型、推理框架之间的协同程度,正越来越直接地决定最终的模型性能。

与此同时,AI开源生态也已形成高度成熟的算子体系,FlashAttention、DeepGEMM、FlashMLA、SageAttention等项目正不断成为主流推理框架和模型的重要依赖。如何同时做到充分发挥硬件性能、快速跟进模型演进、兼容成熟开源生态、降低开发者迁移成本,是构建完整GPU AI软件栈的关键命题。

MATE高性能算子库

针对上述挑战,摩尔线程MATE算子库提供高性能的Attention、GEMM、MoE及稀疏/量化计算等算子能力。

  • 底层通过Assembly、MUTLASS、TileLang-MUSA等多种实现后端进行针对性优化。
  • 上层通过Wrapper兼容FlashAttention、DeepGEMM、FlashMLA、SageAttention等主流开源项目,并进一步连接vLLM、SGLang等推理生态。

MATE并非简单的算子集合,而是连接上层应用与底层硬件、贯通摩尔线程全功能GPU与生成式AI软件生态的高性能计算基础设施。为此,MATE从性能优化、生态兼容、工程体验三个维度构建了核心能力。

1. 高性能优化

MATE针对大模型真实工作负载进行优化,而非仅关注单一Kernel的理论性能。通过多种Kernel后端的协同设计,MATE在追求极致性能的同时,亦保持了针对快速算法迭代的敏捷响应能力。

  • 在Attention方向:覆盖FlashAttention-3 Fwd/Bwd、FlashMLA、SageAttention、DeepSeek稀疏注意力(HCA/CSA)、GDN、KDA、MSA等。
  • 在GEMM与MoE方向:覆盖Dense GEMM、Grouped GEMM、Mixed-DType MoE GEMM(S4FP8/FP4FP8等)以及DeepGEMM MQA Logits/mHC。

2. AI生态兼容

在生态兼容上,MATE的设计理念是:让开发者尽可能复用已有代码,无需为迁移GPU而重新开发。目前,MATE已为主流开源算子项目提供兼容Wrapper,开发者可沿用原有API使用方式,底层由MATE算子执行。

  • FlashAttention-3:兼容原生package、import及API使用方式,支持SGLang/vLLM FA3 fork场景。
  • DeepGEMM:兼容原生API,覆盖Grouped GEMM、MQA Logits、mHC等能力。
  • FlashMLA:兼容原生使用方式,覆盖Dense/Sparse场景。
  • SageAttention:提供标准sageattn接口,支持FP8/INT8等量化计算模式。
  • FlashKDA、MSA等Wrapper也已支持前沿大模型的推理需求。

基于上述能力,MATE已落地vLLM与SGLang推理框架,提供核心Attention与GEMM算子的底层执行能力,支撑广泛的大模型推理场景。

3. 完整工程能力

除了关注算子性能,MATE同样重视开发者的实际使用体验,让算子不仅性能高,更易用、易集成、易调试。

  • JIT编译:MATE算子全面支持JIT编译,可根据运行环境与Workload灵活编译。
  • TVM-FFI ABI:解耦Torch版本依赖,降低环境变动带来的影响。
  • MATE CLI:提供mate show-config、mate env等命令,帮助开发者快速查看环境、版本与调试配置。
  • Guard Allocator:用于定位GPU illegal memory access等问题。
  • mate-mubin:管理汇编Kernel,同时支持在线与离线部署场景。

性能实测:从算子到模型

在Kernel层面,MATE核心算子在真实工作负载下表现出极高效率(以SOL即Speed-of-Light衡量,代表实际性能占硬件峰值算力或者峰值带宽的比例):

摩尔线程开源高性能MATE算子库 释放全功能GPU算力潜能

在模型层面,MATE作为底层算子引擎,与vLLM-MUSA、SGLang-MUSA推理框架深度协同,已支撑DeepSeek-V4、Kimi K3、GLM-5.3、Qwen3.8、MiniMax H3/M3等前沿大模型的Day-0部署与性能优化。在部分推理场景中,基于MATE的摩尔线程全功能GPU单卡吞吐量已达到国际高端GPU的40%以上。

开源共建

摩尔线程将持续深耕开源生态,不断丰富MATE高性能算子矩阵。MATE当前版本为v0.2.6,开发者可前往摩尔线程GitHub官方仓库获取MATE最新版本、安装指南、API文档、Tutorial、Benchmark、Release Notes、Issue与Discussion。

摩尔线程诚挚邀请广大开发者参与共建,共同推动高性能算子引擎持续演进,繁荣国产AI算力生态,让国产算力在更多AI商业化核心场景中释放价值。

MATE开源地址

https://github.com/MooreThreads/mate

MATE技术文档

https://mate-docs.mthreads.com/latest/

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐