NVIDIA RTX 5080 SUPER
GPURTX 5080 SUPER(CES 2026 传闻):24GB 显存,GDDR7 28 Gbps,320-bit 总线。本地 70B Q4_K_M 单卡可装。
9
运行记录
9
覆盖模型
1
覆盖框架
L0 自报 × 9
证据分布
典型性能表现
同硬件上各模型 × 框架 × 量化的已上架实测均值。
- llama.cpp · Q5_K_M Decode 32.7 · Prefill 245.3 ·
- llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
- llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
- llama.cpp · Q4_K_M Decode 20.6 · Prefill 154.5 ·
- llama.cpp · IQ2_XS Decode 6.4 · Prefill 48 ·
- llama.cpp · Q5_K_M Decode 16.8 · Prefill 126 ·
- llama.cpp · IQ2_XS Decode 3.6 · Prefill 27 ·
- llama.cpp · Q4_K_M Decode 20 · Prefill 150 ·
- llama.cpp · Q4_K_M Decode 178.3 · Prefill 1337.3 ·
核心规格
- 厂商
- NVIDIA
- 架构
- Blackwell
- 显存
- 24 GB
- 显存带宽
- 1120 GB/s
- TDP 功耗
- 400 W
- 发布日期
- 2026-03-01
运行记录
共 9 组配置
| 模型 | 框架 | 量化 | Decode | 生成耗时 | 样本数 |
|---|---|---|---|---|---|
| Qwen3.5-35B-A3B | llama.cpp | Q5_K_M | 32.7 tok/s | — | 1 |
| DeepSeek-V4.1-Flash | llama.cpp | IQ2_XS | 3.4 tok/s | — | 1 |
| GLM-5.3 | llama.cpp | IQ2_XS | 3.4 tok/s | — | 1 |
| Mistral Large 3 70B | llama.cpp | Q4_K_M | 20.6 tok/s | — | 1 |
| Llama 5 405B | llama.cpp | IQ2_XS | 6.4 tok/s | — | 1 |
| Llama 5 70B | llama.cpp | Q5_K_M | 16.8 tok/s | — | 1 |
| Qwen 4 720B | llama.cpp | IQ2_XS | 3.6 tok/s | — | 1 |
| Qwen 4 72B | llama.cpp | Q4_K_M | 20 tok/s | — | 1 |
| Qwen 4 8B | llama.cpp | Q4_K_M | 178.3 tok/s | — | 1 |