选定 Cluster Badcase 数
23
占全部 badcase 的 19.2%
Trace 关联成功率
91%
21/23 已绑定
同类目正确 Case(对照组)
87
mathematics 类目
关联精度
Level 2
多条件 fuzzy join
📊 指标对比分析
Badcase 组 vs 正确 Case 组(Mann-Whitney U 检验) p < 0.05 显著| 指标 | Badcase 均值 | 正确 Case 均值 | 差异 (%) | p 值 | 效应量 (Cohen's d) | 效应量 |
|---|---|---|---|---|---|---|
| kv_cache_hit_rate | 0.31 | 0.67 | -53.7% | < 0.001 | 0.78 | |
| num_preemptions | 3.2 | 0.8 | +300% | < 0.001 | 0.65 | |
| decode_ms_per_token | 18.3 | 11.2 | +63.4% | < 0.001 | 0.52 | |
| batch_size_at_inference | 14.2 | 13.8 | +2.9% | 0.312 | 0.08 | |
| ttft_ms | 234 | 220 | +6.4% | 0.320 | 0.08 | |
| prompt_tokens | 156 | 148 | +5.4% | 0.245 | 0.06 | |
| completion_tokens | 89 | 82 | +8.5% | 0.041 | 0.18 |
🌲 决策树定界
多因素交互分析(max_depth=3)kv_cache_hit_rate ≤ 0.35 (n=110)
YES →
preemptions > 2 (n=38)
YES →
错误率 89% ⚠ 高风险分支 (n=18)
NO →
错误率 42% (n=20)
NO →
decode_ms_per_token > 15 (n=72)
YES →
错误率 31% (n=28)
NO →
错误率 12% ✅ 正常范围 (n=44)
解读:当 kv_cache_hit ≤ 0.35 且 preemptions > 2 时,错误率从基线的 12% 跃升至 89%。这两个因素的交互效应是单一因素无法解释的。
📈 关键指标分布对比
Badcase vs 正确 Case📊
KV Cache 命中率分布
Badcase: μ=0.31 | 正确: μ=0.67 | p<0.001
📉
Preemption 次数分布
Badcase: μ=3.2 | 正确: μ=0.8 | p<0.001
🎯 定界结论
推理调度模块
Prefix Caching
KV Cache 策略
该 Cluster(计算题中间步骤出错,23 cases)的 badcase 表现出持续且显著的 KV cache 低命中率(0.31 vs 正常 0.67)和 高 preemption 率(3.2 次 vs 正常 0.8 次)。
计算类题目的 prompt 模式(长上下文、多步推理、中间计算步骤作为上下文依赖)与当前 prefix caching 的 eviction 策略不匹配。中间推理步骤的 KV cache 被过早逐出,导致后续步骤无法命中缓存,每次 decode 都需要重新计算前缀 → token 级 decode 耗时从 11.2ms 跃升至 18.3ms(+63%)→ 多步推理链因延迟累积而断裂或出错。
该问题可能与 vLLM 从 0.5.2 升级到 0.6.1 时 prefix caching 策略的变更相关。建议对比 0.5.2 同类工作负载的 KV cache 指标以确认是否为版本回归。
💡 优化建议
基于归因结果
高优先级 ×2
中优先级 ×1
-
1
调优 prefix caching 的 eviction 策略针对数学推理类工作负载的长上下文依赖特征,提高 prefix caching 的 TTL 或启用 sliding window eviction,避免中间推理步骤的 KV cache 过早逐出。建议调参方向:
--max-model-len和--gpu-memory-utilization。 -
2
对比 vLLM 0.5.2 的同类指标,确认为版本回归在当前归因分析面板中选择 vLLM 0.5.2 对应 MMLU 数学类目的历史 run,对比 KV cache 命中率和 preemption 次数的变化趋势。如果 0.5.2 中无此异常,定位引入回归的 commit。
-
3
增加 KV cache 预算或启用 offload如果 GPU 内存允许,增加 KV cache 的 GPU 预算;否则考虑启用 CPU offload(
--cpu-offload-gb)来扩展有效缓存容量,降低 eviction 频率。
📈 vLLM 版本间指标趋势
同 Benchmark(MMLU mathematics)KV Cache 命中率
Preemptions
Accuracy
vLLM 0.5.2
0.72
KV Cache Hit Rate
vLLM 0.6.1
0.31
KV Cache Hit Rate
变化
-56.9%
⚠ 显著退化