NVIDIA RTX 5080 SUPER

GPU

RTX 5080 SUPER(CES 2026 传闻):24GB 显存,GDDR7 28 Gbps,320-bit 总线。本地 70B Q4_K_M 单卡可装。

9

运行记录

9

覆盖模型

1

覆盖框架

L0 自报 × 9

证据分布

典型性能表现

同硬件上各模型 × 框架 × 量化的已上架实测均值。

  1. llama.cpp · Q5_K_M Decode 32.7 · Prefill 245.3 ·
  2. llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
  3. llama.cpp · IQ2_XS Decode 3.4 · Prefill 25.5 ·
  4. llama.cpp · Q4_K_M Decode 20.6 · Prefill 154.5 ·
  5. llama.cpp · IQ2_XS Decode 6.4 · Prefill 48 ·
  6. llama.cpp · Q5_K_M Decode 16.8 · Prefill 126 ·
  7. llama.cpp · IQ2_XS Decode 3.6 · Prefill 27 ·
  8. llama.cpp · Q4_K_M Decode 20 · Prefill 150 ·
  9. llama.cpp · Q4_K_M Decode 178.3 · Prefill 1337.3 ·

核心规格

厂商
NVIDIA
架构
Blackwell
显存
24 GB
显存带宽
1120 GB/s
TDP 功耗
400 W
发布日期
2026-03-01

运行记录

共 9 组配置

模型框架量化Decode生成耗时样本数
Qwen3.5-35B-A3Bllama.cppQ5_K_M32.7 tok/s—1
DeepSeek-V4.1-Flashllama.cppIQ2_XS3.4 tok/s—1
GLM-5.3llama.cppIQ2_XS3.4 tok/s—1
Mistral Large 3 70Bllama.cppQ4_K_M20.6 tok/s—1
Llama 5 405Bllama.cppIQ2_XS6.4 tok/s—1
Llama 5 70Bllama.cppQ5_K_M16.8 tok/s—1
Qwen 4 720Bllama.cppIQ2_XS3.6 tok/s—1
Qwen 4 72Bllama.cppQ4_K_M20 tok/s—1
Qwen 4 8Bllama.cppQ4_K_M178.3 tok/s—1