桃子桃子快讯
返回首页
工具

双卡 4090+5060Ti 本地推理实测:35B MoE 达 206 t/s

Reddit 用户晒出 RTX 4090 加 5060Ti 双卡主机对 Qwen 系列模型的推理速度测试,并对比了 MT…

2026.07.30 · 周四3 分钟阅读

近日 Reddit r/LocalLLaMA 板块用户 /u/Dry_Long3157 发布了一组双卡主机运行 Qwen 系列模型的推理基准数据。配置为 RTX 4090(24GB)加 RTX 5060 Ti(16GB),搭配 i9-13900K 处理器与 64GB DDR5 内存,通过 WSL2 分配 47GB 给虚拟机,使用 CUDA 12.8(作者提示 13.1 会在 Blackwell 上让 llama.cpp 的 MMQ 内核段错误并静默回退到 cuBLAS,导致 prompt 处理速度下降约 6 倍),llama.cpp 编译目标为 sm_89;sm_120。测试在 131K 上下文、q8_0 KV cache 的短代码生成场景下完成。

实测速度

作者给出多组关键数字,单位为 tokens/s:

  • Qwen3-27B dense,Q4_K_XL,仅 4090:MTP 开 101–118 t/s,MTP 关 44 t/s
  • Qwen3-27B dense,Q6_K_XL,双卡分层放置:64 t/s
  • Qwen3-35B-A3B,Q4_K_XL,4090 加上 6 层 expert 溢出:MTP 开 206 t/s,MTP 关 113 t/s
  • Qwen3-122B-A10B,IQ3_S,4090 + 5060 Ti 加约 15GB 系统内存:37–41 t/s(MTP 开),24 t/s(MTP 关)

MTP 与显存分层策略

作者特别强调多 token 预测(MTP)带来的收益:在 35B-A3B 模型上 MTP 开启时推理速度较关闭提升约 80%,122B 模型上亦提升约 60%。在 122B 模型测试中,49 层中有 17 层被放置到系统 RAM 中,仍跑出 37–41 t/s 的速度,高于多数人在 8B 模型上的水平。

需要留意的细节

文中提及的「Qwen3.6-27B」「Qwen3.6-35B-A3B」「Qwen3.5-122B-A10B」等命名与目前公开的 Qwen3 系列(dense 至 32B、MoE 为 30B-A3B 与 235B-A22B)并不完全一致,可能为预发布版本、社区修改版量化,或是原作者笔误/虚构名称,引用时建议交叉核对原始仓库。

工程价值

作者把所有启动脚本、回归门禁与原始数据汇总在 GitHub 仓库 github.com/04RR/qServer,并说明汇总文件由 Claude Code 生成。对于计划在 4090 + 5060 Ti 组合上跑 MoE 模型、考虑内存溢出或启用 MTP 的本地推理玩家,这组数据可作为参数选择的起点。

信源