AMD 双 R9700 平台:PCIe Gen5 x8+x8 比 Gen4 x16+x4 提速约 18-32%
Reddit 社区用户在双 AMD R9700 AI 平台上实测,vLLM 推理从 PCIe Gen4 x16+x4 升…
近期 Reddit 用户 Ramzeus 在 r/LocalLLaMA 分享了一组双 AMD R9700 平台 PCIe 配置升级对比测试:将两块显卡从 PCIe Gen4 x16+Gen4 x4 切换为 Gen5 x8+Gen5 x8 后,vLLM 推理吞吐与延迟均获得约 18-32% 的改善,且各档位首 token 延迟降幅均在 34% 以上。
升级背景与硬件配置
作者原平台使用 MSI PRO-X670-P-WIFI 主板,搭配两块 Gigabyte AI PRO R9700 AI TOP 32G,分别以 Gen4 x16 与 Gen4 x4 直连 CPU。考虑到张量并行(tensor parallelism)下通道配置不对称可能影响多卡协作,作者将主板更换为 Asus ProArt X870E-Creator WIFI,把两张显卡均调整为 Gen5 x8 直连 CPU。新旧两套平台下 GPU 间的 P2P(peer-to-peer)通信均正常工作。
其余关键配置保持一致:CPU 为 AMD 9950X,内存为 64 GB DDR5-6000,操作系统为 Ubuntu 26.04,推理框架为 stilldeadcode/vllm-radiance:0.7.4,被测模型为 Qwen 3.8 27B fp8,KV cache 自动(fp16)。
基准测试结果
测试工具为 guidellm,分别在 1、2、4 路并发下记录 PP(prompt processing)与 TG(token generation)吞吐、TTFT(首 token 延迟)、TPOT(每 token 平均生成时间)以及端到端延迟。结果汇总如下:
- 单并发:PP 569.85 → 671.89 tok/s(+17.9%);TG 64.12 → 75.21 tok/s(+17.3%);TTFT 11823.10 → 7741.98 ms(+34.5%);TPOT 15.96 → 13.53 ms(+15.2%);端到端延迟 51.09 → 43.31 s(+15.2%)。
- 2 并发:PP 949.01 → 1089.25 tok/s(+14.8%);TG 98.87 → 114.22 tok/s(+15.5%);TTFT 13957.38 → 8976.44 ms(+35.7%);TPOT 20.61 → 17.86 ms(+13.3%);延迟 65.94 → 57.14 s(+13.4%)。
- 4 并发:PP 1172.07 → 1495.44 tok/s(+27.6%);TG 115.56 → 152.88 tok/s(+32.3%);TTFT 21001.50 → 13566.46 ms(+35.4%);TPOT 29.93 → 24.24 ms(+19.0%);延迟 95.77 → 77.57 s(+19.0%)。
TTFT(首 token 延迟)在全部三档并发下改善最为显著,幅度均在 34% 以上;4 并发档 TG 吞吐提升最大,达 32.3%,提示随着并发数上升,PCIe 通道配对对张量并行的收益会被进一步放大。
启示与局限
- 对计划搭建 AMD 双 GPU AI 工作站的用户而言,把两张卡均衡分配到 Gen5 x8+x8(而不是 Gen4 x16+x4 这种不对等组合),可能比单纯追求单卡最高通道数更有利于张量并行下的多卡通信。
- 该结论来自单一用户的单平台、单模型、单框架版本测试,尚未见到第三方独立复现;高并发下收益更明显的现象也表明,小批量场景下的瓶颈未必落在 PCIe 通道上。
- 作者本人表示仍在权衡这次升级「值不值」——原 Gen4 平台已经能满足日常推理需求,而换主板的时间与金钱成本并不低。
对于关心 AMD 平台 LLM 推理吞吐上限的开发者来说,这一组数据至少提供了一个可参考的方向:多卡搭建时,通道均衡往往比单卡峰值更重要。
