推理成本总览

一眼对比各活跃模型在 MI355X、B200、B300、GB200 与 GB300 上的表现。

GPU 租赁成本 / 每百万输出 token · 8K→1K · @30 tok/s/用户 · ↓ 越低越好

数据库快照截至 7月30日

  • DeepSeek V4 Pro 1.6T

    B200
    约 $3.34。根据已验证的基准运行结果估算。7月12日
    vLLM · FP4
    MI355X
    约 $1.31。根据已验证的基准运行结果估算。比 B200 便宜 61%7月28日
    ATOM¹ · FP4
    B300
    约 $2.53。根据已验证的基准运行结果估算。比 B200 便宜 24%7月12日
    vLLM · FP4
    GB200
    约 $1.80。根据已验证的 8P+8D 运行结果估算。比 B200 便宜 46%5月19日
    Dynamo vLLM · FP4
    GB300
    约 $0.81。根据已验证的 32P+8D 与 24P+8D 运行结果估算。比 B200 便宜 76%6月3日
    Dynamo SGLang · FP4
    查看详情
  • Kimi K2.5/2.6/2.7-Code 1T

    B200
    约 $0.48。根据已验证的 16P+8D 与 12P+8D 运行结果估算。7月22日
    Dynamo TRTLLM · FP4 · 标准解码
    MI355X
    约 $1.15。根据已验证的 4P+4D 运行结果估算。比 B200 昂贵 138%7月16日
    Mooncake ATOMesh¹ · FP4 · 标准解码
    B300
    约 $1.96。根据已验证的基准运行结果估算。比 B200 昂贵 308%6月7日
    vLLM · FP4 · 标准解码
    GB200
    约 $0.51。根据已验证的 36P+16D 与 28P+16D 运行结果估算。比 B200 昂贵 6%6月20日
    Dynamo TRTLLM · FP4 · 标准解码
    GB300
    约 $0.62。根据已验证的 16P+8D 与 32P+24D 运行结果估算。比 B200 昂贵 28%6月20日
    Dynamo vLLM · FP4 · 标准解码
    查看详情
  • MiniMax M3 428B

    B200
    约 $0.87。根据已验证的基准运行结果估算。7月29日
    vLLM · FP8
    MI355X
    约 $0.59。根据已验证的基准运行结果估算。比 B200 便宜 32%7月3日
    ATOM¹ · FP4
    B300
    约 $0.64。根据已验证的基准运行结果估算。比 B200 便宜 26%7月29日
    vLLM · FP4
    GB200
    约 $0.66。根据已验证的 20P+16D 与 12P+16D 运行结果估算。比 B200 便宜 24%7月29日
    Dynamo vLLM · FP8 · 标准解码
    GB300
    约 $0.63。根据已验证的 12P+8D 与 6P+8D 运行结果估算。比 B200 便宜 28%7月29日
    Dynamo vLLM · FP8 · 标准解码
    查看详情
  • Qwen3.5 397B

    B200
    约 $0.51。根据已验证的基准运行结果估算。6月24日
    TRTLLM · FP4
    MI355X
    约 $0.76。根据已验证的基准运行结果估算。比 B200 昂贵 50%7月16日
    SGLang · FP4
    B300
    约 $0.96。根据已验证的基准运行结果估算。比 B200 昂贵 90%5月21日
    SGLang · FP8
    GB200
    无精确 @30 结果
    GB300
    无精确 @30 结果
    查看详情

优先顺序:推测解码 FP4 → 推测解码 FP8 → 标准解码 FP4 → 标准解码 FP8。

成本 = 3 年期租赁 $/GPU/小时 ÷ 每张已部署 GPU 的输出 tok/s。所有百分比均相对 B200。

方向性平台对比:各单元格取该平台最佳观测包络线,日期、引擎、精度与解码方式可能不同。

分离式结果的分母同时计入预填充与解码 GPU。

∞ = 无可比结果

各档位数值采用最佳观测平台服务包络线;≈ 表示根据已验证运行结果估算。不会外推。