vllm-loop model-improvement progress tracker junk-tokens
models / / #26
▲ MADE POSITIVE PROGRESS

PP6 vs PP8 measured - PP6 wins c1 and KV efficiency

Both accuracy-gated. PP6: c1 96.9 (8-tok) / 103.8 @4k / 49.4 @32k vs PP8 43.2 / 32.2 / 27.6; KV 10.95 GiB per 1M (PP8 23.06); 512k c16 88.3 (86.8); decode agg 128k c8 164 (128). PP8 only wins total pool (6.17M vs 2.89M tokens) and some prefill. PP8 is the slowest PP option at c1.

When (PT)2026-09-11 23:16 PT

Benchmarks

MetricValueΔ vs previousUnitContextNote
c1_decode_32k_tok_s (c1_decode_32k_tok_s) 49.4 tok/s -44.1% tok/s PP6 @32k (PP8 27.6)
c1_decode_tok_s (c1_decode_tok_s) 96.9 tok/s 124.3% tok/s PP6 pure single-stream 8-tok (PP8 43.2)
kv_gib_per_1m (kv_gib_per_1m) 10.95 GiB -52.5% GiB PP6, 11,214 B/token (PP8 23,617)

raw JSON: /api/reports/26