NVIDIA RTX 5080 SUPER
GPURTX 5080 SUPER (rumored, CES 2026): 24GB VRAM, GDDR7 28 Gbps, 320-bit bus. Local 70B Q4_K_M single-card fit.
9
Run records
9
Models covered
1
Frameworks covered
L0 Self-reported × 9
Evidence mix
Typical measured performance
Published benchmark averages per model × framework × quantization on this hardware.
- llama.cpp · Q5_K_M Decode 32.7 · Prefill 245.3 ·
- llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
- llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
- llama.cpp · Q4_K_M Decode 20.6 · Prefill 154.5 ·
- llama.cpp · IQ2_XS Decode 6.4 · Prefill 48 ·
- llama.cpp · Q5_K_M Decode 16.8 · Prefill 126 ·
- llama.cpp · IQ2_XS Decode 3.6 · Prefill 27 ·
- llama.cpp · Q4_K_M Decode 20 · Prefill 150 ·
- llama.cpp · Q4_K_M Decode 178.3 · Prefill 1337.3 ·
Key specs
- Vendor
- NVIDIA
- Architecture
- Blackwell
- VRAM
- 24 GB
- Memory bandwidth
- 1120 GB/s
- TDP
- 400 W
- Release date
- 2026-03-01
Run records
9 configurations
| Model | Framework | Quantization | Decode | Gen time | Samples |
|---|---|---|---|---|---|
| Qwen3.5-35B-A3B | llama.cpp | Q5_K_M | 32.7 tok/s | — | 1 |
| DeepSeek-V4.1-Flash | llama.cpp | IQ2_XS | 3.4 tok/s | — | 1 |
| GLM-5.3 | llama.cpp | IQ2_XS | 3.4 tok/s | — | 1 |
| Mistral Large 3 70B | llama.cpp | Q4_K_M | 20.6 tok/s | — | 1 |
| Llama 5 405B | llama.cpp | IQ2_XS | 6.4 tok/s | — | 1 |
| Llama 5 70B | llama.cpp | Q5_K_M | 16.8 tok/s | — | 1 |
| Qwen 4 720B | llama.cpp | IQ2_XS | 3.6 tok/s | — | 1 |
| Qwen 4 72B | llama.cpp | Q4_K_M | 20 tok/s | — | 1 |
| Qwen 4 8B | llama.cpp | Q4_K_M | 178.3 tok/s | — | 1 |