NVIDIA RTX 4080 Super
GPUNVIDIA Ada Lovelace (AD103): 16 GB GDDR6X on a 256-bit bus, 736 GB/s of memory bandwidth, 320 W board power.
30
Run records
5
Models covered
4
Frameworks covered
L0 Self-reported × 30
Evidence mix
Typical measured performance
Published benchmark averages per model × framework × quantization on this hardware.
- llama.cpp · Q6_K Decode 18.2 · Prefill 136.5 ·
- llama.cpp · Q5_K_S Decode 23.6 · Prefill 177 ·
- llama.cpp · IQ3_S Decode 39.3 · Prefill 294.8 ·
- llama.cpp · IQ4_XS Decode 29.6 · Prefill 222 ·
- SGLang · Q4_K_M Decode 3.1 · Prefill 23.3 ·
- SGLang · IQ3_S Decode 4.7 · Prefill 35.3 ·
- SGLang · IQ4_XS Decode 3.5 · Prefill 26.3 ·
- vLLM · Q4_K_M Decode 3.2 · Prefill 24 ·
- vLLM · IQ3_S Decode 4.8 · Prefill 36 ·
- vLLM · IQ4_XS Decode 3.6 · Prefill 27 ·
- vLLM · Q4_K_M Decode 3.6 · Prefill 27 ·
- vLLM · IQ3_S Decode 5.4 · Prefill 40.5 ·
- vLLM · IQ4_XS Decode 4.1 · Prefill 30.7 ·
- llama.cpp · Q4_K_M Decode 3.3 · Prefill 24.8 ·
- llama.cpp · IQ3_S Decode 5 · Prefill 37.5 ·
- llama.cpp · IQ4_XS Decode 3.7 · Prefill 27.8 ·
- Strata · Q5_K_S Decode 40.4 · Prefill 303 ·
- Strata · IQ3_S Decode 67.5 · Prefill 506.3 ·
- Strata · IQ4_XS Decode 50.4 · Prefill 378 ·
- llama.cpp · IQ4_XS Decode 39.3 · Prefill 294.8 ·
- llama.cpp · Q5_K_S Decode 31.5 · Prefill 236.3 ·
- llama.cpp · IQ3_XXS Decode 60.4 · Prefill 453 ·
- llama.cpp · IQ3_S Decode 52.7 · Prefill 395.3 ·
- llama.cpp · Q6_K Decode 24.2 · Prefill 181.5 ·
- vLLM · IQ2_XS Decode 59.6 · Prefill 447 ·
- vLLM · Q5_K_M Decode 27.2 · Prefill 204 ·
- vLLM · Q4_K_M Decode 33.3 · Prefill 249.7 ·
- llama.cpp · IQ2_XS Decode 54.7 · Prefill 410.3 ·
- llama.cpp · Q5_K_M Decode 25 · Prefill 187.5 ·
- llama.cpp · Q4_K_M Decode 30.5 · Prefill 228.8 ·
Key specs
- Vendor
- NVIDIA
- Architecture
- Ada Lovelace
- VRAM
- 16 GB
- Memory bandwidth
- 736 GB/s
- TDP
- 320 W
- Release date
- 2024-01-31
Run records
30 configurations
| Model | Framework | Quantization | Decode | Gen time | Samples |
|---|---|---|---|---|---|
| Qwen3.5-35B-A3B | llama.cpp | Q6_K | 18.2 tok/s | — | 1 |
| Qwen3.5-35B-A3B | llama.cpp | Q5_K_S | 23.6 tok/s | — | 1 |
| Qwen3.5-35B-A3B | llama.cpp | IQ3_S | 39.3 tok/s | — | 1 |
| Qwen3.5-35B-A3B | llama.cpp | IQ4_XS | 29.6 tok/s | — | 1 |
| GLM-5.3-Flash | SGLang | Q4_K_M | 3.1 tok/s | — | 1 |
| GLM-5.3-Flash | SGLang | IQ3_S | 4.7 tok/s | — | 1 |
| GLM-5.3-Flash | SGLang | IQ4_XS | 3.5 tok/s | — | 1 |
| GLM-5.3-Flash | vLLM | Q4_K_M | 3.2 tok/s | — | 1 |
| GLM-5.3-Flash | vLLM | IQ3_S | 4.8 tok/s | — | 1 |
| GLM-5.3-Flash | vLLM | IQ4_XS | 3.6 tok/s | — | 1 |
| DeepSeek-V4-Flash | vLLM | Q4_K_M | 3.6 tok/s | — | 1 |
| DeepSeek-V4-Flash | vLLM | IQ3_S | 5.4 tok/s | — | 1 |
| DeepSeek-V4-Flash | vLLM | IQ4_XS | 4.1 tok/s | — | 1 |
| DeepSeek-V4-Flash | llama.cpp | Q4_K_M | 3.3 tok/s | — | 1 |
| DeepSeek-V4-Flash | llama.cpp | IQ3_S | 5 tok/s | — | 1 |
| DeepSeek-V4-Flash | llama.cpp | IQ4_XS | 3.7 tok/s | — | 1 |
| Qwen3.8-27B | Strata | Q5_K_S | 40.4 tok/s | — | 1 |
| Qwen3.8-27B | Strata | IQ3_S | 67.5 tok/s | — | 1 |
| Qwen3.8-27B | Strata | IQ4_XS | 50.4 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | IQ4_XS | 39.3 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | Q5_K_S | 31.5 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | IQ3_XXS | 60.4 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | IQ3_S | 52.7 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | Q6_K | 24.2 tok/s | — | 1 |
| gemma-4-31B-it | vLLM | IQ2_XS | 59.6 tok/s | — | 1 |
| gemma-4-31B-it | vLLM | Q5_K_M | 27.2 tok/s | — | 1 |
| gemma-4-31B-it | vLLM | Q4_K_M | 33.3 tok/s | — | 1 |
| gemma-4-31B-it | llama.cpp | IQ2_XS | 54.7 tok/s | — | 1 |
| gemma-4-31B-it | llama.cpp | Q5_K_M | 25 tok/s | — | 1 |
| gemma-4-31B-it | llama.cpp | Q4_K_M | 30.5 tok/s | — | 1 |