Local Inference

← Gemma 3 4B IT Q4_K_M · 32k ctx, q8_0 KV

Run a2caf10e

Kindspeed
Started2026-09-15 18:42 UTC
Duration37 s
Enginellama.cpp@91f6a6cf3 (build 10883)
Driver595.99.02
Throttledno
Commandlab bench gemma-3-4b-it-q4_k_m-gguf/32k-q8kv --wait
Lab version0.1.0+16df55c

Metrics

MetricMethodPromptGenDepthValue± sdUnit
gpu_w_avgllama-bench1280210W
gpu_w_avgllama-bench1284k214W
gpu_w_avgllama-bench5124k196W
gpu_w_avgllama-bench12816k222W
gpu_w_avgllama-bench51216k211W
pp_tpsllama-bench51207,855574t/s
pp_tpsllama-bench5124k7,369426t/s
pp_tpsllama-bench51216k6,598332t/s
proc_rss_peak_mbllama-bench16k2,761MiB
ram_peak_mbllama-bench16k16,252MiB
tg_tpsllama-bench12801660.44t/s
tg_tpsllama-bench1284k1610.66t/s
tg_tpsllama-bench12816k1560.60t/s
tokens_per_joulellama-bench12800.79tok/J
tokens_per_joulellama-bench1284k0.75tok/J
tokens_per_joulellama-bench5124k37.7tok/J
tokens_per_joulellama-bench12816k0.70tok/J
tokens_per_joulellama-bench51216k31.2tok/J
vram_peak_mbllama-bench16k3,474MiB

Raw

{
  "bench": {
    "n_prompt": 512,
    "n_gen": 128,
    "depths": [
      0,
      4096,
      16384
    ],
    "reps": 5,
    "delay_s": 3,
    "http_prompt_lengths": [
      512,
      4096
    ]
  },
  "telemetry_summary": {
    "vram_baseline_mb": 0.9375,
    "vram_peak_mb": 3475.125,
    "ram_baseline_mb": 14929.046875,
    "ram_peak_mb": 16252.12890625,
    "proc_rss_peak_mb": 2760.8046875,
    "temp_max_c": 52,
    "power_max_w": 249.645,
    "clock_max_mhz": 1620,
    "throttled": false,
    "power_capped_frac": 0.43956043956043955,
    "phases": {
      "llama-bench": {
        "duration_s": 36.45752109802561,
        "energy_j": 6060.605,
        "power_avg_w": 166.2374406560576
      }
    }
  }
}