Local Inference

← Gemma 3 4B IT Q4_K_M · 32k ctx, f16 KV

Run 2c8f0cca

Kindspeed
Started2026-09-15 18:41 UTC
Duration36 s
Enginellama.cpp@91f6a6cf3 (build 10883)
Driver595.99.02
Throttledno
Commandlab bench gemma-3-4b-it-q4_k_m-gguf/32k-f16kv --wait
Lab version0.1.0+16df55c

Metrics

MetricMethodPromptGenDepthValue± sdUnit
gpu_w_avgllama-bench1280207W
gpu_w_avgllama-bench5120100W
gpu_w_avgllama-bench1284k214W
gpu_w_avgllama-bench5124k169W
gpu_w_avgllama-bench12816k215W
gpu_w_avgllama-bench51216k208W
pp_tpsllama-bench51208,196503t/s
pp_tpsllama-bench5124k7,662381t/s
pp_tpsllama-bench51216k6,875347t/s
proc_rss_peak_mbllama-bench16k2,761MiB
ram_peak_mbllama-bench16k16,256MiB
tg_tpsllama-bench12801800.83t/s
tg_tpsllama-bench1284k1710.08t/s
tg_tpsllama-bench12816k1630.28t/s
tokens_per_joulellama-bench12800.87tok/J
tokens_per_joulellama-bench512081.6tok/J
tokens_per_joulellama-bench1284k0.80tok/J
tokens_per_joulellama-bench5124k45.3tok/J
tokens_per_joulellama-bench12816k0.76tok/J
tokens_per_joulellama-bench51216k33.0tok/J
vram_peak_mbllama-bench16k3,706MiB

Raw

{
  "bench": {
    "n_prompt": 512,
    "n_gen": 128,
    "depths": [
      0,
      4096,
      16384
    ],
    "reps": 5,
    "delay_s": 3,
    "http_prompt_lengths": [
      512,
      4096
    ]
  },
  "telemetry_summary": {
    "vram_baseline_mb": 0.9375,
    "vram_peak_mb": 3707.125,
    "ram_baseline_mb": 16034.60546875,
    "ram_peak_mb": 16256.09375,
    "proc_rss_peak_mb": 2760.6796875,
    "temp_max_c": 49,
    "power_max_w": 249.833,
    "clock_max_mhz": 1620,
    "throttled": false,
    "power_capped_frac": 0.42696629213483145,
    "phases": {
      "llama-bench": {
        "duration_s": 35.65426458104048,
        "energy_j": 5794.421,
        "power_avg_w": 162.51691257940692
      }
    }
  }
}