基准指标
每兆瓦 token 吞吐量
也称为 tokens per megawatt、tokens/MW、功率归一化吞吐量
先用大白话
该指标衡量数据中心在固定电力额度下能产出多少 AI token。
技术定义
每兆瓦 token 吞吐量衡量推理产出相对于数据中心电力预算的效率。
常用单位
每单位配置市电兆瓦的 token/秒
工程细节
InferenceX 使用全口径公用事业供电,而不只使用芯片 TDP。这个分母可包含为 IT 负载供电和制冷的开销,更适合设施级容量规划。
为什么重要
电力供应往往是新增 AI 部署的硬约束。每兆瓦生成更多 token 的系统,即使单个加速器功耗更高,也能在相同电力配额下服务更多需求。
如何在 InferenceX 中解读
比较 tokens/MW 时必须匹配模型、工作负载、精度与交互性,否则高吞吐低交互点可能看似高效,却无法满足目标用户体验。
参考资料
在真实基准中理解这一概念
InferenceMAX:开源推理基准测试
NVIDIA GB200 NVL72、AMD MI355X、每 GPU 吞吐量 Token、延迟 Tok/s/user、性价比、每百万 Token 成本、每配置兆瓦 Token 数、DeepSeek R1 670B、GPTOSS 120B、Llama3 70B
DeepSeekV4 1.6T 第0天至第43天性能演进 — Huawei、GB300 NVL72、MI355X、B200
第0天推理性能、InferenceX、26天内性能提升100倍、每百万 token 成本、Huawei 950DT 推理 Trace 分析
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton