Qwen 3.5 397B-A17B · GPU 对比

Qwen 3.5 397B-A17B — B200 vs RTX PRO 6000

B200NVIDIA Blackwell)与 RTX PRO 6000NVIDIA Blackwell)在 Qwen 3.5 397B-A17B 上的正面 AI 推理基准测试对比。涵盖各类 LLM 工作负载的延迟、吞吐量与成本。使用下方图表控件切换序列、精度和指标——交互方式与主推理图表相同。

在 11–153 tok/s/user 交互性区间的低端,即 Qwen 3.5 397B-A17B 上以 47 tok/s/user 运行时:B200 达到 13489 tok/s/GPU($0.04/百万 token),RTX PRO 6000 达到 1069($0.11/百万)。B200 每 token 成本低 171%;B200 每 GPU 吞吐量高出 1162%。

以 82 tok/s/user 为目标在 Qwen 3.5 397B-A17B 上运行时,B200 产出 10364 tok/s/GPU(每百万 token $0.05),RTX PRO 6000 产出 796($0.15)。B200 每 token 成本低 178%;B200 每 GPU 吞吐量高出 1202%。

在 Qwen 3.5 397B-A17B 上以 118 tok/s/user 交互性运行时,B200 吞吐量为 7489 tok/s/GPU,每百万 token 成本 $0.07;RTX PRO 6000 吞吐量为 538 tok/s/GPU,成本 $0.24。B200 每 token 成本低 235%;B200 每 GPU 吞吐量高出 1292%。 (数据反映此 URL 的默认 8k/1k · fp4 选择——如果您在控件中更改序列、精度或模型,下方表格和图表会自动更新。)

查看每美元性能对比 →

Interpolated from real benchmark data. Edit target interactivity values below to compare at different operating points.
Metric
Interactivity (tok/s/user)
Interactivity (tok/s/user)
Interactivity (tok/s/user)
Throughput (tok/s/gpu)
B200:13488.9RTX PRO 6000:1069.0
B200:10364.1RTX PRO 6000:796.2
B200:7489.3RTX PRO 6000:537.9
Cost ($/M tok)
B200:$0.040RTX PRO 6000:$0.109
B200:$0.052RTX PRO 6000:$0.145
B200:$0.072RTX PRO 6000:$0.242
tok/s/MW
B200:7888235RTX PRO 6000:1096391
B200:6060896RTX PRO 6000:816652
B200:4379733RTX PRO 6000:551701
Concurrency
B200:~299RTX PRO 6000:~12
B200:~143RTX PRO 6000:~5
B200:~16RTX PRO 6000:~2

推理性能

不同模型、硬件配置和服务参数下的推理性能指标。

厂商:
聚合模式:
投机解码: