Qwen 4 系列中型密集模型;72B 参数,推理、代码、长上下文任务均强。
0
量化版本
6
实测记录
量化版本
社区与官方发布的量化版本;「关联实测」只统计精确关联到该发布的实测记录。
还没有已收录的量化版本。
实测数据
共 6 组配置
| 硬件 | 框架 | 量化 | 生成速度 | 运行显存 | 实测次数 | 证据 |
|---|---|---|---|---|---|---|
| Apple M5 Max | llama.cpp | Q4_K_M | 11 tok/s | 44.2 GB | 1 | L0 自报 |
| Apple M4 Max | llama.cpp | IQ2_XS | 17.5 tok/s | 24.8 GB | 1 | L0 自报 |
| NVIDIA RTX 5070 SUPER | Strata | IQ2_XS | 36.9 tok/s | 18 GB | 1 | L0 自报 |
| NVIDIA RTX 5080 SUPER | llama.cpp | Q4_K_M | 20 tok/s | 24 GB | 1 | L0 自报 |
| NVIDIA RTX 5090 | vLLM | Q4_K_M | 34.9 tok/s | 32 GB | 1 | L0 自报 |
| NVIDIA RTX 4090 | llama.cpp | Q4_K_M | 18 tok/s | 24 GB | 1 | L0 自报 |
其中 6 条实测未关联到具体量化版本,完整数据见搜索页。
社区讨论
还没有讨论——发起第一个话题吧。
发起讨论