Local Inference

← Qwen3.8 27B Q4_K_M · 32k ctx, f16 KV

Run 768ae1e3

Kindspeed
Started2026-09-15 18:42 UTC
Duration135 s
Enginellama.cpp@91f6a6cf3 (build 10883)
Driver595.99.02
Throttledno
Commandlab bench qwen3.8-27b-q4_k_m-gguf/32k-f16kv --wait
Lab version0.1.0+16df55c

Metrics

MetricMethodPromptGenDepthValue± sdUnit
gpu_w_avgllama-bench1280245W
gpu_w_avgllama-bench5120173W
gpu_w_avgllama-bench1284k244W
gpu_w_avgllama-bench5124k233W
gpu_w_avgllama-bench12816k242W
gpu_w_avgllama-bench51216k237W
pp_tpsllama-bench512096571.7t/s
pp_tpsllama-bench5124k1,10926.2t/s
pp_tpsllama-bench51216k99815.8t/s
proc_rss_peak_mbllama-bench16k16,063MiB
ram_peak_mbllama-bench16k16,256MiB
tg_tpsllama-bench128032.40.20t/s
tg_tpsllama-bench1284k31.70.10t/s
tg_tpsllama-bench12816k30.30.16t/s
tokens_per_joulellama-bench12800.13tok/J
tokens_per_joulellama-bench51205.58tok/J
tokens_per_joulellama-bench1284k0.13tok/J
tokens_per_joulellama-bench5124k4.75tok/J
tokens_per_joulellama-bench12816k0.13tok/J
tokens_per_joulellama-bench51216k4.21tok/J
vram_peak_mbllama-bench16k17,762MiB

Raw

{
  "bench": {
    "n_prompt": 512,
    "n_gen": 128,
    "depths": [
      0,
      4096,
      16384
    ],
    "reps": 5,
    "delay_s": 3,
    "http_prompt_lengths": [
      512,
      4096
    ]
  },
  "telemetry_summary": {
    "vram_baseline_mb": 0.9375,
    "vram_peak_mb": 17763.125,
    "ram_baseline_mb": 15567.5234375,
    "ram_peak_mb": 16256.37890625,
    "proc_rss_peak_mb": 16062.8203125,
    "temp_max_c": 62,
    "power_max_w": 250.849,
    "clock_max_mhz": 1620,
    "throttled": false,
    "power_capped_frac": 0.7150928167877321,
    "phases": {
      "llama-bench": {
        "duration_s": 124.41050228994573,
        "energy_j": 25794.996,
        "power_avg_w": 207.33776912083596
      }
    }
  }
}