4x NVIDIA Tesla P40

GPU

1

运行记录

1

覆盖模型

1

覆盖框架

L1 已复现 × 1

证据分布

典型性能表现

同硬件上各模型 × 框架 × 量化的已上架实测均值。

  1. llama.cpp · UD-Q3_K_XL Decode 21.6 · Prefill 330 ·

核心规格

厂商
NVIDIA
显存
96 GB

运行记录

共 1 组配置

模型框架量化Decode生成耗时样本数
Qwen3.8-Flash-Nextllama.cppUD-Q3_K_XL21.6 tok/s—1