桃子桃子快讯
返回首页
开源

Meta 发布 MobileMoE 系列:面向手机端侧的亚十亿参数 MoE 模型

Meta 开源 MobileMoE 系列端侧 MoE 大模型,提供 0.3B/0.5B/0.9B 三档激活参数,INT4…

2026.08.25 · 周二3 分钟阅读

Meta 近日在 Hugging Face 上线了 MobileMoE 系列模型,主打面向移动设备的端侧部署。该系列采用 Mixture-of-Experts(MoE)架构,激活参数控制在亚十亿(sub-billion)量级,同时通过 INT4 量化将权重体积压缩到 3GB 以内,使其能够装入常见的移动设备 DRAM 容量。

系列构成与三档规模

MobileMoE 共推出 S、M、L 三档规模,对应激活参数为 0.3B / 0.5B / 0.9B,总参数量分别为 1.3B / 2.8B / 5.3B。每个规模均提供三种变体:

  • Base:完成预训练与中训练(mid-training)的基础模型。
  • SFT:在 Base 基础上做监督微调的版本。
  • QAT:采用量化感知训练(Quantization-Aware Training)的版本,进一步面向端侧部署优化。

此次被提交到 LocalLLaMA 社区的具体仓库为 MobileMoE-L-Base,即 0.9B 激活参数的基础模型。

L 档关键架构细节

以 MobileMoE-L 为例,模型核心配置如下:

  • 激活参数:922M;总参数:5.3B
  • 层数:32,模型维度:1280
  • 注意力头:20 个,KV 头:4 个(GQA),头维度:64
  • 路由专家:60 个细粒度专家,每个 FFN 隐层维度 640
  • 每 token 激活专家:4 个(top-k sigmoid 路由 + 归一化)
  • 共享专家:1 个,始终开启,FFN 隐层维度 2560
  • 词表大小:128,256
  • 其他特性:QK-Norm、输入输出 embedding 绑定、RoPE(θ = 500,000)
  • 上下文长度:8,192 tokens
  • 精度:BF16
  • 支持模态:纯文本输入输出,英文
  • 训练流程:预训练 → 中训练

定位与许可

MobileMoE 主打「在端侧 LLM 的质量–效率帕累托前沿上推进」,目标是在手机等移动设备的内存与算力约束下,保留 MoE 架构带来的容量优势,同时压低激活开销。开发者为 Meta,许可证为 FAIR Non-Commercial(仅限非商用),意味着该系列更适合学术研究和个人实验,商业落地需另行评估授权。

(说明:原始资料中标注的发布日期为「Aug 2026」,结合该模型在社区中已出现下载与讨论的时间线,该时间戳疑似排版或录入错误,实际公开发布应为 2024–2025 年间。)

信源