2x NVIDIA RTX 5090

台式机

3

运行记录

3

覆盖模型

1

覆盖框架

L0 自报 × 3

证据分布

典型性能表现

同硬件上各模型 × 框架 × 量化的已上架实测均值。

  1. llama.cpp · UD-Q8_K_XL Decode 32.08 · Prefill 671.43 ·
  2. llama.cpp · UD-IQ4_XS Decode 21.96 · Prefill 421.07 ·
  3. llama.cpp · UD-IQ2_XXS Decode 19.39 · Prefill 692.41 ·

核心规格

显存
64 GB

运行记录

共 3 组配置

模型框架量化Decode样本数
DeepSeek-V4-Flash-Vision-Expllama.cppUD-Q8_K_XL32.1 tok/s1
GLM-5.3-Flashllama.cppUD-IQ4_XS22 tok/s1
DeepSeek-V4-Flashllama.cppUD-IQ2_XXS19.4 tok/s1