桃子桃子快讯
返回首页
开源8 小时快讯 · 2026.06.26 11:23

英伟达开源 NeMo AutoModel:MoE 微调提速 3.7 倍

英伟达开源 NeMo AutoModel,兼容 Hugging Face Transformers v5,MoE 微调吞…

2026.06.26 · 周五4 分钟阅读

英伟达最新研究成果 NeMo AutoModel 已在 GitHub 开源,面向大规模生成式 AI 模型的构建与微调场景。该工具在 Hugging Face Transformers v5 之上进行扩展,用户无需修改原有代码 API,仅需增加一行 import,即可获得更快的 MoE 模型微调速度。官方实验数据显示,相比 Transformers v5,NeMo AutoModel 可在 MoE 微调中实现 3.4–3.7 倍的训练吞吐提升,并减少 29%–32% 的 GPU 显存占用。

性能基准:吞吐与显存双提升

在单节点 8×H100 80GB GPU 配置下,以 Qwen3-30B-A3B 为测试对象,NeMo AutoModel 将 TPS/GPU(每 GPU 每秒吞吐量)从 3075 提升至 11340,加速比达到 3.69 倍。对于 Qwen3 模型,峰值显存从 68.2 GiB 降至 48.1 GiB,降幅 29%;在 Nemotron Nano 模型上,显存从 62.1 GiB 降至 42.5 GiB,降幅 32%。释放出的显存空间可用于支持更大批次或更长序列。

英伟达还展示了 Nemotron 3 Ultra 550B A55B 在 16 个 H100 节点、共 128 张 GPU 上的全参数微调结果:TPS/GPU 为 815,TFLOP/s/GPU 约为 293,峰值显存为 58.2 GiB。由于 Transformers v5 在该规模下会出现显存溢出,因此这一组数据未做直接对比。

核心技术:专家并行 + DeepEP + Transformer Engine

NeMo AutoModel 在 Transformers v5 基础上集成了三项关键技术,分别针对 MoE 训练中的内存、通信和计算瓶颈。

  • 专家并行(Expert Parallelism, EP):将专家权重分布到多张 GPU 上,每张 GPU 只持有部分专家参数。以 8 张 GPU、ep_size=8 为例,单卡 MoE 内存占用可降至原来的约 1/8,从而显著降低显存压力。
  • DeepEP:实现计算与通信的融合,把 token 分发与组合操作整合进优化后的 GPU 内核,使通信过程与专家计算重叠,削弱通信开销对训练速度的拖累。
  • Transformer Engine:为融合注意力机制、线性层、RMSNorm 等核心运算提供加速实现,覆盖 MoE 层与普通 Transformer 层。

使用方式与开源资源

对于已在使用 Transformers v5 的开发者而言,NeMo AutoModel 是一个近乎无痛的升级方案:只需在原有代码基础上新增一行 import,即可获得约 3 倍的 MoE 微调加速效果,同时降低显存占用。

目前,英伟达已将代码、配置与基准测试脚本开放:

随着 MoE 成为前沿大模型的主流架构,训练与微调的基础设施需求也在持续上升。NeMo AutoModel 以兼容 Hugging Face 生态的方式切入,为开发者提供了一条门槛较低的提速路径。

信源