Local Inference

← Qwen3.8 27B Q4_K_M · 32k ctx, q8_0 KV

Run 906a5086

Kindspeed
Started2026-09-15 18:45 UTC
Duration159 s
Enginellama.cpp@91f6a6cf3 (build 10883)
Driver595.99.02
Throttledno
Commandlab bench qwen3.8-27b-q4_k_m-gguf/32k-q8kv --wait
Lab version0.1.0+16df55c

Metrics

MetricMethodPromptGenDepthValue± sdUnit
gpu_w_avgllama-bench1280247W
gpu_w_avgllama-bench5120174W
gpu_w_avgllama-bench1284k245W
gpu_w_avgllama-bench5124k227W
gpu_w_avgllama-bench12816k245W
gpu_w_avgllama-bench51216k240W
pp_tpsllama-bench51201,037127t/s
pp_tpsllama-bench5124k1,09123.3t/s
pp_tpsllama-bench51216k98814.8t/s
proc_rss_peak_mbllama-bench16k16,144MiB
ram_peak_mbllama-bench16k16,256MiB
tg_tpsllama-bench128031.70.29t/s
tg_tpsllama-bench1284k30.80.19t/s
tg_tpsllama-bench12816k28.20.10t/s
tokens_per_joulellama-bench12800.13tok/J
tokens_per_joulellama-bench51205.97tok/J
tokens_per_joulellama-bench1284k0.13tok/J
tokens_per_joulellama-bench5124k4.80tok/J
tokens_per_joulellama-bench12816k0.12tok/J
tokens_per_joulellama-bench51216k4.11tok/J
vram_peak_mbllama-bench16k17,268MiB

Raw

{
  "bench": {
    "n_prompt": 512,
    "n_gen": 128,
    "depths": [
      0,
      4096,
      16384
    ],
    "reps": 5,
    "delay_s": 3,
    "http_prompt_lengths": [
      512,
      4096
    ]
  },
  "telemetry_summary": {
    "vram_baseline_mb": 0.9375,
    "vram_peak_mb": 17269.125,
    "ram_baseline_mb": 14852.2890625,
    "ram_peak_mb": 16256.44921875,
    "proc_rss_peak_mb": 16143.81640625,
    "temp_max_c": 64,
    "power_max_w": 252.324,
    "clock_max_mhz": 1620,
    "throttled": false,
    "power_capped_frac": 0.7097026604068858,
    "phases": {
      "llama-bench": {
        "duration_s": 128.24278868595138,
        "energy_j": 26670.47,
        "power_avg_w": 207.96857486710027
      }
    }
  }
}