DeepSeek V4 Pro 1.6T
8K/1K
B200
vLLM · FP4
MI355X
$0.104比 B200 便宜 53%
ATOM¹ · FP4
B300
$0.182比 B200 便宜 17%
vLLM · FP4
GB200 NVL72
$0.225与 B200 成本基本持平
Dynamo vLLM · FP4
GB300 NVL72
无精确 @30 结果
超大规模云(hyperscaler)成本 ↓ 越低越好 来源:InferenceX 与 SemiAnalysis Market July 2026 AI Cloud TCO Model
| 模型 · 场景 | B200 · 基准 | MI355X | B300 | GB200 NVL72 | GB300 NVL72 |
|---|---|---|---|---|---|
DeepSeek V4 Pro 1.6T8K/1K | vLLM · FP4 | $0.104比 B200 便宜 53% ATOM¹ · FP4 | $0.182比 B200 便宜 17% vLLM · FP4 | $0.225与 B200 成本基本持平 Dynamo vLLM · FP4 | 无精确 @30 结果 |
DeepSeek V4 Pro 1.6T长上下文多轮真实智能体场景(AgentX) | 无精确 @30 结果 | $0.010缺少可比较的 B200 基线 SGLang · FP4 | $0.007缺少可比较的 B200 基线 vLLM · FP4 | 无精确 @30 结果 | 无精确 @30 结果 |
Kimi K3 2.8T长上下文多轮真实智能体场景(AgentX) | Dynamo vLLM · FP4 | $0.038比 B200 便宜 26% ATOM¹ · FP4 | $0.080比 B200 昂贵 55% vLLM · FP4 | $0.076比 B200 昂贵 48% Dynamo vLLM · FP4 | $0.034比 B200 便宜 34% Dynamo vLLM · FP4 |
Kimi K2.5/2.6/2.7-Code 1T8K/1K | vLLM · FP4 · STP | $0.094比 B200 便宜 7% ATOM¹ · FP4 · STP | $0.124比 B200 昂贵 22% vLLM · FP4 · STP | 无精确 @30 结果 | 无精确 @30 结果 |
MiniMax M3 428B8K/1K | vLLM · FP8 | $0.047比 B200 便宜 19% ATOM¹ · FP4 | $0.046比 B200 便宜 20% vLLM · FP4 | $0.086比 B200 昂贵 49% Dynamo vLLM · FP8 · STP | 无精确 @30 结果 |
MiniMax M3 428B长上下文多轮真实智能体场景(AgentX) | 无精确 @30 结果 | 无精确 @30 结果 | 无精确 @30 结果 | 无精确 @30 结果 | 无精确 @30 结果 |
GLM5.2长上下文多轮真实智能体场景(AgentX) | 无精确 @30 结果 | $0.013缺少可比较的 B200 基线 ATOM¹ · FP4 | 无精确 @30 结果 | 无精确 @30 结果 | 无精确 @30 结果 |
Qwen3.5 397B8K/1K | TRTLLM · FP4 | $0.042比 B200 昂贵 25% SGLang · FP4 | $0.069比 B200 昂贵 107% SGLang · FP8 | 无精确 @30 结果 | 无精确 @30 结果 |
Qwen3.5 397B长上下文多轮真实智能体场景(AgentX) | 无精确 @30 结果 | $0.007缺少可比较的 B200 基线 SGLang · FP8 | 无精确 @30 结果 | 无精确 @30 结果 | 无精确 @30 结果 |
8K/1K
长上下文多轮真实智能体场景(AgentX)
长上下文多轮真实智能体场景(AgentX)
8K/1K
8K/1K
长上下文多轮真实智能体场景(AgentX)
长上下文多轮真实智能体场景(AgentX)
8K/1K
长上下文多轮真实智能体场景(AgentX)
— = 无结果。∞ = 缺少 B200 基线。
若某款芯片不支持 FP4 推测解码,则采用次优的可用配置。