Qwen3-8B

8B对话由 Qwen 发布 发起讨论

0

量化版本

18

实测记录

量化版本

社区与官方发布的量化版本;「关联实测」只统计精确关联到该发布的实测记录。

还没有已收录的量化版本。

实测数据

共 18 组配置

硬件框架量化生成速度运行显存实测次数证据
NVIDIA RTX 5060 SUPERllama.cppQ8_040.6 tok/s9.1 GB1L0 自报
NVIDIA RTX 5060 SUPERllama.cppQ5_K_M59.2 tok/s6.4 GB1L0 自报
NVIDIA RTX 5060 SUPERllama.cppQ4_K_M71.3 tok/s5.4 GB1L0 自报
NVIDIA RTX 5070 SUPERllama.cppQ8_081.3 tok/s9.1 GB1L0 自报
NVIDIA RTX 5070 SUPERllama.cppQ5_K_M118.5 tok/s6.4 GB1L0 自报
NVIDIA RTX 5070 SUPERllama.cppQ4_K_M142.6 tok/s5.4 GB1L0 自报
NVIDIA RTX 3090llama.cppQ8_084.9 tok/s9.1 GB1L0 自报
NVIDIA RTX 3090llama.cppQ5_K_M123.7 tok/s6.4 GB1L0 自报
NVIDIA RTX 3090llama.cppQ4_K_M149 tok/s5.4 GB1L0 自报
NVIDIA RTX 5070llama.cppQ8_060.9 tok/s9.1 GB1L0 自报
NVIDIA RTX 5070llama.cppQ5_K_M88.8 tok/s6.4 GB1L0 自报
NVIDIA RTX 5070llama.cppQ4_K_M107 tok/s5.4 GB1L0 自报
NVIDIA RTX 5090llama.cppQ8_0162.5 tok/s9.1 GB1L0 自报
NVIDIA RTX 5090llama.cppQ5_K_M236.9 tok/s6.4 GB1L0 自报
NVIDIA RTX 5090llama.cppQ4_K_M285.3 tok/s5.4 GB1L0 自报
NVIDIA RTX 4090llama.cppQ8_091.4 tok/s9.1 GB1L0 自报
NVIDIA RTX 4090llama.cppQ5_K_M133.3 tok/s6.4 GB1L0 自报
NVIDIA RTX 4090llama.cppQ4_K_M160.5 tok/s5.4 GB1L0 自报

其中 18 条实测未关联到具体量化版本,完整数据见搜索页。

社区讨论

还没有讨论——发起第一个话题吧。

发起讨论