Local Inference

← Qwen3.8 27B Q4_K_M · 64k ctx, q8_0 KV

Run 468f250b

Kindspeed
Started2026-09-15 18:47 UTC
Duration168 s
Enginellama.cpp@91f6a6cf3 (build 10883)
Driver595.99.02
Throttledno
Commandlab bench qwen3.8-27b-q4_k_m-gguf/64k-q8kv --wait
Lab version0.1.0+16df55c

Metrics

MetricMethodPromptGenDepthValue± sdUnit
gpu_w_avgllama-bench1280246W
gpu_w_avgllama-bench5120151W
gpu_w_avgllama-bench1284k245W
gpu_w_avgllama-bench5124k227W
gpu_w_avgllama-bench12816k244W
gpu_w_avgllama-bench51216k240W
pp_tpsllama-bench512094973.6t/s
pp_tpsllama-bench5124k1,09125.1t/s
pp_tpsllama-bench51216k98715.4t/s
proc_rss_peak_mbllama-bench16k16,159MiB
ram_peak_mbllama-bench16k16,257MiB
tg_tpsllama-bench128031.80.24t/s
tg_tpsllama-bench1284k30.90.21t/s
tg_tpsllama-bench12816k28.20.12t/s
tokens_per_joulellama-bench12800.13tok/J
tokens_per_joulellama-bench51206.29tok/J
tokens_per_joulellama-bench1284k0.13tok/J
tokens_per_joulellama-bench5124k4.81tok/J
tokens_per_joulellama-bench12816k0.12tok/J
tokens_per_joulellama-bench51216k4.11tok/J
vram_peak_mbllama-bench16k17,268MiB

Raw

{
  "bench": {
    "n_prompt": 512,
    "n_gen": 128,
    "depths": [
      0,
      4096,
      16384
    ],
    "reps": 5,
    "delay_s": 3,
    "http_prompt_lengths": [
      512,
      4096
    ]
  },
  "telemetry_summary": {
    "vram_baseline_mb": 0.9375,
    "vram_peak_mb": 17269.125,
    "ram_baseline_mb": 15561.1875,
    "ram_peak_mb": 16256.51953125,
    "proc_rss_peak_mb": 16158.8125,
    "temp_max_c": 64,
    "power_max_w": 251.301,
    "clock_max_mhz": 1620,
    "throttled": false,
    "power_capped_frac": 0.7132757266300078,
    "phases": {
      "llama-bench": {
        "duration_s": 127.7395631740219,
        "energy_j": 26606.137,
        "power_avg_w": 208.28423347396281
      }
    }
  }
}