归因分析
Run: Cluster:
选定 Cluster Badcase 数
23
占全部 badcase 的 19.2%
Trace 关联成功率
91%
21/23 已绑定
同类目正确 Case(对照组)
87
mathematics 类目
关联精度
Level 2
多条件 fuzzy join

📊 指标对比分析

Badcase 组 vs 正确 Case 组(Mann-Whitney U 检验) p < 0.05 显著
指标 Badcase 均值 正确 Case 均值 差异 (%) p 值 效应量 (Cohen's d) 效应量
kv_cache_hit_rate 0.31 0.67 -53.7% < 0.001 0.78
num_preemptions 3.2 0.8 +300% < 0.001 0.65
decode_ms_per_token 18.3 11.2 +63.4% < 0.001 0.52
batch_size_at_inference 14.2 13.8 +2.9% 0.312 0.08
ttft_ms 234 220 +6.4% 0.320 0.08
prompt_tokens 156 148 +5.4% 0.245 0.06
completion_tokens 89 82 +8.5% 0.041 0.18

🌲 决策树定界

多因素交互分析(max_depth=3)
kv_cache_hit_rate ≤ 0.35 (n=110)
YES → preemptions > 2 (n=38)
YES → 错误率 89% ⚠ 高风险分支 (n=18)
NO → 错误率 42% (n=20)
NO → decode_ms_per_token > 15 (n=72)
YES → 错误率 31% (n=28)
NO → 错误率 12% ✅ 正常范围 (n=44)
解读:kv_cache_hit ≤ 0.35preemptions > 2 时,错误率从基线的 12% 跃升至 89%。这两个因素的交互效应是单一因素无法解释的。

📈 关键指标分布对比

Badcase vs 正确 Case
📊
KV Cache 命中率分布
Badcase: μ=0.31 | 正确: μ=0.67 | p<0.001
📉
Preemption 次数分布
Badcase: μ=3.2 | 正确: μ=0.8 | p<0.001

🎯 定界结论

推理调度模块 Prefix Caching KV Cache 策略

该 Cluster(计算题中间步骤出错,23 cases)的 badcase 表现出持续且显著的 KV cache 低命中率(0.31 vs 正常 0.67)和 高 preemption 率(3.2 次 vs 正常 0.8 次)。

计算类题目的 prompt 模式(长上下文、多步推理、中间计算步骤作为上下文依赖)与当前 prefix caching 的 eviction 策略不匹配。中间推理步骤的 KV cache 被过早逐出,导致后续步骤无法命中缓存,每次 decode 都需要重新计算前缀 → token 级 decode 耗时从 11.2ms 跃升至 18.3ms(+63%)→ 多步推理链因延迟累积而断裂或出错。

该问题可能与 vLLM 从 0.5.2 升级到 0.6.1 时 prefix caching 策略的变更相关。建议对比 0.5.2 同类工作负载的 KV cache 指标以确认是否为版本回归。

💡 优化建议

基于归因结果
高优先级 ×2 中优先级 ×1
  • 1
    调优 prefix caching 的 eviction 策略
    针对数学推理类工作负载的长上下文依赖特征,提高 prefix caching 的 TTL 或启用 sliding window eviction,避免中间推理步骤的 KV cache 过早逐出。建议调参方向:--max-model-len--gpu-memory-utilization
  • 2
    对比 vLLM 0.5.2 的同类指标,确认为版本回归
    在当前归因分析面板中选择 vLLM 0.5.2 对应 MMLU 数学类目的历史 run,对比 KV cache 命中率和 preemption 次数的变化趋势。如果 0.5.2 中无此异常,定位引入回归的 commit。
  • 3
    增加 KV cache 预算或启用 offload
    如果 GPU 内存允许,增加 KV cache 的 GPU 预算;否则考虑启用 CPU offload(--cpu-offload-gb)来扩展有效缓存容量,降低 eviction 频率。

📈 vLLM 版本间指标趋势

同 Benchmark(MMLU mathematics)
KV Cache 命中率
Preemptions
Accuracy
vLLM 0.5.2
0.72
KV Cache Hit Rate
vLLM 0.6.1
0.31
KV Cache Hit Rate
变化
-56.9%
⚠ 显著退化