4x NVIDIA Tesla P40
GPU1
运行记录
1
覆盖模型
1
覆盖框架
L1 已复现 × 1
证据分布
典型性能表现
同硬件上各模型 × 框架 × 量化的已上架实测均值。
- llama.cpp · UD-Q3_K_XL Decode 21.6 · Prefill 330 ·
核心规格
- 厂商
- NVIDIA
- 显存
- 96 GB
运行记录
共 1 组配置
| 模型 | 框架 | 量化 | Decode | 生成耗时 | 样本数 |
|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | llama.cpp | UD-Q3_K_XL | 21.6 tok/s | — | 1 |