怎样读一个推理性能数字
先明确比较的对象,再讨论加速比。
推理系统中的一个吞吐数字,只对应某组具体条件。模型、精度、输入与输出长度、并发方式、缓存状态和统计口径,都会改变它的含义。
先看基线
“提升了 3.81 倍”需要说明相对哪个版本。Qwen3 Runtime 中的这个数字,比较的是最初测量路径和后来的冻结路径,包含多项优化的累积效果。
如果把它解释成某一个 CUDA Graph 或融合算子的收益,就改变了原始实验的比较对象。
再看工作负载
单请求 decode、固定批次吞吐、长上下文 prefill 和在线服务的尾延迟,是不同的问题。一个系统在固定批次下很快,不代表它在受延迟约束的在线负载下也能承载同样比例的请求。
比较不同运行时,需要记录前缀缓存、分块 prefill、输入输出长度、并发模式与进程隔离条件。缓存污染或不一致的生成长度,都可能让表面上的优势失去解释力。
最后看证据范围
好的记录应当让人找到原始结果和有效配置,并区分冻结基线与探索性实验。未完成的对照、变化中的代码和合成的等待时间,都应当跟随结果一起说明。
对我来说,性能分析的产出除了一个更小的耗时,还包括对“为什么变快、在什么条件下成立”的理解。