0
量化版本
41
实测记录
量化版本
社区与官方发布的量化版本;「关联实测」只统计精确关联到该发布的实测记录。
还没有已收录的量化版本。
实测数据
共 41 组配置
| 硬件 | 框架 | 量化 | 生成速度 | 运行显存 | 实测次数 | 证据 |
|---|---|---|---|---|---|---|
| NVIDIA RTX 4090 | llama.cpp | IQ2_M | 324 tok/s | 3.96 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 4090 | llama.cpp | Q2_K | 306.6 tok/s | 4.06 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 4090 | Strata | IQ1_S | 287.9 tok/s | 3.6 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 4090 | Strata | Q2_K | 285.8 tok/s | 4.06 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 3090 | llama.cpp | Q3_K_L | 227.4 tok/s | 4.67 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 3090 | llama.cpp | Q5_K_S | 175.4 tok/s | 5.31 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 3090 | Strata | Q6_K | 215.6 tok/s | 5.67 GB | 1 | L2 跨框架验证 |
| Apple M3 Max | vLLM | IQ2_XS | 309.1 tok/s | 3.81 GB | 1 | L2 跨框架验证 |
| Apple M3 Max | vLLM | Q3_K_L | 226.5 tok/s | 4.67 GB | 1 | L2 跨框架验证 |
| Apple M3 Max | Ollama | FP16 | 96.8 tok/s | 8.7 GB | 1 | L2 跨框架验证 |
| Apple M3 Max | Ollama | IQ4_XS | 188.4 tok/s | 4.75 GB | 1 | L2 跨框架验证 |
| Apple M3 Max | Strata | Q5_K_S | 239.1 tok/s | 5.31 GB | 1 | L2 跨框架验证 |
| AMD Radeon RX 7900 XTX | llama.cpp | IQ3_XS | 234.5 tok/s | 4.32 GB | 1 | L2 跨框架验证 |
| AMD Radeon RX 7900 XTX | llama.cpp | Q4_K_M | 178.7 tok/s | 5.03 GB | 1 | L2 跨框架验证 |
| AMD Radeon RX 7900 XTX | Ollama | Q3_K_M | 196.2 tok/s | 4.53 GB | 1 | L2 跨框架验证 |
| AMD Radeon RX 7900 XTX | Ollama | Q8_0 | 111.3 tok/s | 6.21 GB | 1 | L2 跨框架验证 |
| AMD Radeon RX 7900 XTX | Strata | Q4_K_S | 249 tok/s | 4.88 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5090 | llama.cpp | Q5_K_M | 353.8 tok/s | 5.42 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5090 | llama.cpp | Q6_K | 345.1 tok/s | 5.67 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5090 | Ollama | FP16 | 199.3 tok/s | 8.7 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5090 | Strata | Q2_K | 300.6 tok/s | 4.06 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5090 | Strata | Q4_K_M | 280.2 tok/s | 5.03 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5080 | llama.cpp | Q4_K_S | 194.2 tok/s | 4.88 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5080 | llama.cpp | Q8_0 | 121.4 tok/s | 6.21 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5080 | Ollama | Q3_K_M | 198.4 tok/s | 4.53 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5080 | Ollama | Q8_0 | 116.4 tok/s | 6.21 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 3060 12GB | llama.cpp | Q2_K | 169.7 tok/s | 4.06 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 3060 12GB | vLLM | Q3_K_L | 134.6 tok/s | 4.67 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 3060 12GB | vLLM | Q8_0 | 84.5 tok/s | 6.21 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5070 | vLLM | IQ2_M | 185.9 tok/s | 3.96 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5070 | Ollama | Q3_K_L | 127.9 tok/s | 4.67 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5070 | Ollama | Q5_K_M | 93 tok/s | 5.42 GB | 1 | L2 跨框架验证 |
| NVIDIA RTX 5070 | Strata | Q3_K_L | 187.6 tok/s | 4.67 GB | 1 | L2 跨框架验证 |
| Apple M4 Max | vLLM | IQ3_S | 318.2 tok/s | 4.45 GB | 1 | L2 跨框架验证 |
| Apple M4 Max | vLLM | Q5_K_S | 322.7 tok/s | 5.31 GB | 1 | L2 跨框架验证 |
| Apple M4 Max | Strata | IQ2_XS | 304.1 tok/s | 3.81 GB | 1 | L2 跨框架验证 |
| Intel Arc B580 | llama.cpp | IQ2_XS | 140.5 tok/s | 3.81 GB | 1 | L2 跨框架验证 |
| Intel Arc B580 | llama.cpp | Q6_K | 72.1 tok/s | 5.67 GB | 1 | L2 跨框架验证 |
| Intel Arc B580 | vLLM | IQ3_S | 115.6 tok/s | 4.45 GB | 1 | L2 跨框架验证 |
| Intel Arc B580 | vLLM | Q3_K_M | 109.1 tok/s | 4.53 GB | 1 | L2 跨框架验证 |
| Intel Arc B580 | Strata | IQ3_S | 143.1 tok/s | 4.45 GB | 1 | L2 跨框架验证 |
其中 41 条实测未关联到具体量化版本,完整数据见搜索页。
社区讨论
还没有讨论——发起第一个话题吧。
发起讨论