搜索实测数据

试试这些搜索

找到 1 条相关运行记录

模型GLM-5.3-Flash硬件 全部框架 全部量化 全部证据等级 全部来源平台 全部

GLM-5.3-Flash · UD-IQ4_XS

L0 自报

2x NVIDIA RTX 5090 · 64GB · llama.cpp

GitHub

今天

21.96 tok/s

Decode

421.07 tok/s

Prefill

0.6 s

TTFT

60.3 GB

VRAM

配置(最近一次实测):

Ubuntu 24.04.4 LTS CUDA 13.3 UD-IQ4_XS llama.cpp moecachev1.6-rc0

来源:GitHub · 1 次实测 · 1 个独立来源

共 1 条结果