yuzheng310
← 全部笔记

怎样读一个推理性能数字

先明确比较的对象,再讨论加速比。

推理系统中的一个吞吐数字,只对应某组具体条件。模型、精度、输入与输出长度、并发方式、缓存状态和统计口径,都会改变它的含义。

先看基线

“提升了 3.81 倍”需要说明相对哪个版本。Qwen3 Runtime 中的这个数字,比较的是最初测量路径和后来的冻结路径,包含多项优化的累积效果。

如果把它解释成某一个 CUDA Graph 或融合算子的收益,就改变了原始实验的比较对象。

再看工作负载

单请求 decode、固定批次吞吐、长上下文 prefill 和在线服务的尾延迟,是不同的问题。一个系统在固定批次下很快,不代表它在受延迟约束的在线负载下也能承载同样比例的请求。

比较不同运行时,需要记录前缀缓存、分块 prefill、输入输出长度、并发模式与进程隔离条件。缓存污染或不一致的生成长度,都可能让表面上的优势失去解释力。

最后看证据范围

好的记录应当让人找到原始结果和有效配置,并区分冻结基线与探索性实验。未完成的对照、变化中的代码和合成的等待时间,都应当跟随结果一起说明。

对我来说,性能分析的产出除了一个更小的耗时,还包括对“为什么变快、在什么条件下成立”的理解。

相关数字和边界见 项目记录源码仓库

返回笔记列表