英伟达开源 NeMo AutoModel:MoE 微调提速 3.7 倍
英伟达开源 NeMo AutoModel,兼容 Hugging Face Transformers v5,MoE 微调吞…
英伟达最新研究成果 NeMo AutoModel 已在 GitHub 开源,面向大规模生成式 AI 模型的构建与微调场景。该工具在 Hugging Face Transformers v5 之上进行扩展,用户无需修改原有代码 API,仅需增加一行 import,即可获得更快的 MoE 模型微调速度。官方实验数据显示,相比 Transformers v5,NeMo AutoModel 可在 MoE 微调中实现 3.4–3.7 倍的训练吞吐提升,并减少 29%–32% 的 GPU 显存占用。
性能基准:吞吐与显存双提升
在单节点 8×H100 80GB GPU 配置下,以 Qwen3-30B-A3B 为测试对象,NeMo AutoModel 将 TPS/GPU(每 GPU 每秒吞吐量)从 3075 提升至 11340,加速比达到 3.69 倍。对于 Qwen3 模型,峰值显存从 68.2 GiB 降至 48.1 GiB,降幅 29%;在 Nemotron Nano 模型上,显存从 62.1 GiB 降至 42.5 GiB,降幅 32%。释放出的显存空间可用于支持更大批次或更长序列。
英伟达还展示了 Nemotron 3 Ultra 550B A55B 在 16 个 H100 节点、共 128 张 GPU 上的全参数微调结果:TPS/GPU 为 815,TFLOP/s/GPU 约为 293,峰值显存为 58.2 GiB。由于 Transformers v5 在该规模下会出现显存溢出,因此这一组数据未做直接对比。
核心技术:专家并行 + DeepEP + Transformer Engine
NeMo AutoModel 在 Transformers v5 基础上集成了三项关键技术,分别针对 MoE 训练中的内存、通信和计算瓶颈。
- 专家并行(Expert Parallelism, EP):将专家权重分布到多张 GPU 上,每张 GPU 只持有部分专家参数。以 8 张 GPU、ep_size=8 为例,单卡 MoE 内存占用可降至原来的约 1/8,从而显著降低显存压力。
- DeepEP:实现计算与通信的融合,把 token 分发与组合操作整合进优化后的 GPU 内核,使通信过程与专家计算重叠,削弱通信开销对训练速度的拖累。
- Transformer Engine:为融合注意力机制、线性层、RMSNorm 等核心运算提供加速实现,覆盖 MoE 层与普通 Transformer 层。
使用方式与开源资源
对于已在使用 Transformers v5 的开发者而言,NeMo AutoModel 是一个近乎无痛的升级方案:只需在原有代码基础上新增一行 import,即可获得约 3 倍的 MoE 微调加速效果,同时降低显存占用。
目前,英伟达已将代码、配置与基准测试脚本开放:
- 代码仓库:https://github.com/NVIDIA-NeMo/Automodel/tree/blog/transformers-v5-automodel/blog_experiments
- 使用指南:https://docs.nvidia.com/nemo/automodel/latest/get-started/hf-compatibility
随着 MoE 成为前沿大模型的主流架构,训练与微调的基础设施需求也在持续上升。NeMo AutoModel 以兼容 Hugging Face 生态的方式切入,为开发者提供了一条门槛较低的提速路径。
