Group-wise low-rank compression with quantization for prefill and decode memory.
Quantization overhead includes scale (fp16) and optionally base (fp16, asymmetric only) per group, amortised over each element. group_size = 0 means per-row (one scale per row).
Effective α (full model)
—
vs. dense fp16 baseline
Prefill-only α
—
ignoring decode buffers
Compressed (MB)
—
baseline: —
r_k / r_v
—
resolved ranks
Effective bits = data bits + scale overhead + base overhead (if asymmetric). Scale is fp16 (16 bits) per group_size elements. Base is an additional fp16 per group_size elements for asymmetric quantization.