NVIDIA RTX 4080 Super
GPUAda Lovelace 架构(AD103),16GB GDDR6X / 256-bit 位宽,显存带宽 736 GB/s,整卡功耗 320W。
30
运行记录
5
覆盖模型
4
覆盖框架
L0 自报 × 30
证据分布
典型性能表现
同硬件上各模型 × 框架 × 量化的已上架实测均值。
- llama.cpp · Q6_K Decode 18.2 · Prefill 136.5 ·
- llama.cpp · Q5_K_S Decode 23.6 · Prefill 177 ·
- llama.cpp · IQ3_S Decode 39.3 · Prefill 294.8 ·
- llama.cpp · IQ4_XS Decode 29.6 · Prefill 222 ·
- SGLang · Q4_K_M Decode 3.1 · Prefill 23.3 ·
- SGLang · IQ3_S Decode 4.7 · Prefill 35.3 ·
- SGLang · IQ4_XS Decode 3.5 · Prefill 26.3 ·
- vLLM · Q4_K_M Decode 3.2 · Prefill 24 ·
- vLLM · IQ3_S Decode 4.8 · Prefill 36 ·
- vLLM · IQ4_XS Decode 3.6 · Prefill 27 ·
- vLLM · Q4_K_M Decode 3.6 · Prefill 27 ·
- vLLM · IQ3_S Decode 5.4 · Prefill 40.5 ·
- vLLM · IQ4_XS Decode 4.1 · Prefill 30.7 ·
- llama.cpp · Q4_K_M Decode 3.3 · Prefill 24.8 ·
- llama.cpp · IQ3_S Decode 5 · Prefill 37.5 ·
- llama.cpp · IQ4_XS Decode 3.7 · Prefill 27.8 ·
- Strata · Q5_K_S Decode 40.4 · Prefill 303 ·
- Strata · IQ3_S Decode 67.5 · Prefill 506.3 ·
- Strata · IQ4_XS Decode 50.4 · Prefill 378 ·
- llama.cpp · IQ4_XS Decode 39.3 · Prefill 294.8 ·
- llama.cpp · Q5_K_S Decode 31.5 · Prefill 236.3 ·
- llama.cpp · IQ3_XXS Decode 60.4 · Prefill 453 ·
- llama.cpp · IQ3_S Decode 52.7 · Prefill 395.3 ·
- llama.cpp · Q6_K Decode 24.2 · Prefill 181.5 ·
- vLLM · IQ2_XS Decode 59.6 · Prefill 447 ·
- vLLM · Q5_K_M Decode 27.2 · Prefill 204 ·
- vLLM · Q4_K_M Decode 33.3 · Prefill 249.7 ·
- llama.cpp · IQ2_XS Decode 54.7 · Prefill 410.3 ·
- llama.cpp · Q5_K_M Decode 25 · Prefill 187.5 ·
- llama.cpp · Q4_K_M Decode 30.5 · Prefill 228.8 ·
核心规格
- 厂商
- NVIDIA
- 架构
- Ada Lovelace
- 显存
- 16 GB
- 显存带宽
- 736 GB/s
- TDP 功耗
- 320 W
- 发布日期
- 2024-01-31
运行记录
共 30 组配置
| 模型 | 框架 | 量化 | Decode | 生成耗时 | 样本数 |
|---|---|---|---|---|---|
| Qwen3.5-35B-A3B | llama.cpp | Q6_K | 18.2 tok/s | — | 1 |
| Qwen3.5-35B-A3B | llama.cpp | Q5_K_S | 23.6 tok/s | — | 1 |
| Qwen3.5-35B-A3B | llama.cpp | IQ3_S | 39.3 tok/s | — | 1 |
| Qwen3.5-35B-A3B | llama.cpp | IQ4_XS | 29.6 tok/s | — | 1 |
| GLM-5.3-Flash | SGLang | Q4_K_M | 3.1 tok/s | — | 1 |
| GLM-5.3-Flash | SGLang | IQ3_S | 4.7 tok/s | — | 1 |
| GLM-5.3-Flash | SGLang | IQ4_XS | 3.5 tok/s | — | 1 |
| GLM-5.3-Flash | vLLM | Q4_K_M | 3.2 tok/s | — | 1 |
| GLM-5.3-Flash | vLLM | IQ3_S | 4.8 tok/s | — | 1 |
| GLM-5.3-Flash | vLLM | IQ4_XS | 3.6 tok/s | — | 1 |
| DeepSeek-V4-Flash | vLLM | Q4_K_M | 3.6 tok/s | — | 1 |
| DeepSeek-V4-Flash | vLLM | IQ3_S | 5.4 tok/s | — | 1 |
| DeepSeek-V4-Flash | vLLM | IQ4_XS | 4.1 tok/s | — | 1 |
| DeepSeek-V4-Flash | llama.cpp | Q4_K_M | 3.3 tok/s | — | 1 |
| DeepSeek-V4-Flash | llama.cpp | IQ3_S | 5 tok/s | — | 1 |
| DeepSeek-V4-Flash | llama.cpp | IQ4_XS | 3.7 tok/s | — | 1 |
| Qwen3.8-27B | Strata | Q5_K_S | 40.4 tok/s | — | 1 |
| Qwen3.8-27B | Strata | IQ3_S | 67.5 tok/s | — | 1 |
| Qwen3.8-27B | Strata | IQ4_XS | 50.4 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | IQ4_XS | 39.3 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | Q5_K_S | 31.5 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | IQ3_XXS | 60.4 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | IQ3_S | 52.7 tok/s | — | 1 |
| Qwen3.8-27B | llama.cpp | Q6_K | 24.2 tok/s | — | 1 |
| gemma-4-31B-it | vLLM | IQ2_XS | 59.6 tok/s | — | 1 |
| gemma-4-31B-it | vLLM | Q5_K_M | 27.2 tok/s | — | 1 |
| gemma-4-31B-it | vLLM | Q4_K_M | 33.3 tok/s | — | 1 |
| gemma-4-31B-it | llama.cpp | IQ2_XS | 54.7 tok/s | — | 1 |
| gemma-4-31B-it | llama.cpp | Q5_K_M | 25 tok/s | — | 1 |
| gemma-4-31B-it | llama.cpp | Q4_K_M | 30.5 tok/s | — | 1 |