📊 评测概览
模型: 时间范围:
评测 Run 总数
24
模型 llama-3-70b | 30d
平均 Accuracy
86.3%
↑ 2.1% vs 上周期
Badcase 总数
647
↓ 12% vs 上周期
C/S 关联成功率
76%
1,892/2,477 traces

📈 各 Benchmark Accuracy 趋势(近 7 次 Run)

88%
Run 18
91%
Run 19
90%
Run 20
87%
Run 21
84%
Run 22
86%
Run 23
88%
Run 24
MMLU GSM8K SWE-Bench

📊 Badcase 分类分布

计算/推理错误218
知识/事实错误156
格式/输出不匹配103
Agent 工具使用错误89
截断/空输出81

📋 评测 Run 列表

共 24 个 Run | 最近更新: 2026-08-05 14:32
Run ID Benchmark 模型 vLLM 版本 Accuracy Samples Badcases 关联率 时间 状态
mmlu-20260805-vllm-0.6.1 MMLU llama-3-70b v0.6.1 88% 1,000 120 91% 2026-08-05 14:32 精度异常
gsm8k-20260803-vllm-0.6.0 GSM8K llama-3-70b v0.6.0 91% 1,319 119 88% 2026-08-03 10:15 待分析
swe-bench-20260801-vllm-0.5.2 SWE-Bench qwen-2.5-72b v0.5.2 72% 500 140 65% 2026-08-01 09:48 精度异常
mmlu-20260730-vllm-0.6.1 MMLU qwen-2.5-72b v0.6.1 94% 1,000 60 95% 2026-07-30 16:20 正常
gsm8k-20260728-vllm-0.5.2 GSM8K llama-3-70b v0.5.2 93% 1,319 92 82% 2026-07-28 11:05 正常
terminal-bench-20260725-v0.5.0 Terminal-Bench llama-3-70b v0.5.0 67% 200 66 41% 2026-07-25 08:30 数据不完整