NVIDIA RTX 5080 SUPER

GPU

RTX 5080 SUPER (rumored, CES 2026): 24GB VRAM, GDDR7 28 Gbps, 320-bit bus. Local 70B Q4_K_M single-card fit.

9

Run records

9

Models covered

1

Frameworks covered

L0 Self-reported × 9

Evidence mix

Typical measured performance

Published benchmark averages per model × framework × quantization on this hardware.

  1. llama.cpp · Q5_K_M Decode 32.7 · Prefill 245.3 ·
  2. llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
  3. llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
  4. llama.cpp · Q4_K_M Decode 20.6 · Prefill 154.5 ·
  5. llama.cpp · IQ2_XS Decode 6.4 · Prefill 48 ·
  6. llama.cpp · Q5_K_M Decode 16.8 · Prefill 126 ·
  7. llama.cpp · IQ2_XS Decode 3.6 · Prefill 27 ·
  8. llama.cpp · Q4_K_M Decode 20 · Prefill 150 ·
  9. llama.cpp · Q4_K_M Decode 178.3 · Prefill 1337.3 ·

Key specs

Vendor
NVIDIA
Architecture
Blackwell
VRAM
24 GB
Memory bandwidth
1120 GB/s
TDP
400 W
Release date
2026-03-01

Run records

9 configurations

ModelFrameworkQuantizationDecodeGen timeSamples
Qwen3.5-35B-A3Bllama.cppQ5_K_M32.7 tok/s—1
DeepSeek-V4.1-Flashllama.cppIQ2_XS3.4 tok/s—1
GLM-5.3llama.cppIQ2_XS3.4 tok/s—1
Mistral Large 3 70Bllama.cppQ4_K_M20.6 tok/s—1
Llama 5 405Bllama.cppIQ2_XS6.4 tok/s—1
Llama 5 70Bllama.cppQ5_K_M16.8 tok/s—1
Qwen 4 720Bllama.cppIQ2_XS3.6 tok/s—1
Qwen 4 72Bllama.cppQ4_K_M20 tok/s—1
Qwen 4 8Bllama.cppQ4_K_M178.3 tok/s—1