返回搜索结果

Qwen3.5-27B · Q5_K_M

发起讨论
2x AMD Radeon RX 7900 XTX48GBllama.cpp b4213L2 跨框架验证

本页汇总 Qwen3.5-27B(Q5_K_M)在 2x AMD Radeon RX 7900 XTX 上以 llama.cpp 运行的 1 次实测数据,来自 1 个独立来源平台;指标为已上架实测的均值。

80 tok/s

Decode

解码速度

948 tok/s

Prefill

预填充速度

1.36 s

TTFT

首 token 延迟

20.2 GB

VRAM

显存占用

L2 跨框架验证

1

实测次数

1

独立来源

其他

来源平台

今天

最后验证

性能表现

  1. llama.cpp · IQ4_XS Decode 108 · Prefill 939 ·
  2. llama.cpp · Q4_K_M Decode 98 · Prefill 892 ·
  3. llama.cpp · Q5_K_M (当前)Decode 80 · Prefill 948 ·
  4. llama.cpp · Q8_0 Decode 66 · Prefill 724 ·
  5. vLLM · IQ4_XS Decode 82 · Prefill 946 ·
  6. vLLM · Q4_K_M Decode 73 · Prefill 855 ·
  7. vLLM · Q5_K_M Decode 75 · Prefill 843 ·
  8. vLLM · Q8_0 Decode 59 · Prefill 489 ·
  9. Ollama · IQ4_XS Decode 94 · Prefill 1095 ·
  10. Ollama · Q4_K_M Decode 87 · Prefill 997 ·
  11. Ollama · Q5_K_M Decode 89 · Prefill 724 ·
  12. Ollama · Q8_0 Decode 59 · Prefill 668 ·
  13. Strata · IQ4_XS Decode 152 · Prefill 1362 ·
  14. Strata · Q4_K_M Decode 139 · Prefill 1188 ·
  15. Strata · Q5_K_M Decode 121 · Prefill 1339 ·
  16. Strata · Q8_0 Decode 87 · Prefill 1027 ·

核心数据

Decode(平均)
80 tok/s
Prefill(平均)
948 tok/s
TTFT(平均)
1.36 s
VRAM(平均)
20.2 GB
MTP 接受率
—
TTFB
— GB
功耗
462 W

基础配置

成员级字段取自最近一次实测

模型
Qwen3.5-27B
量化方式
Q5_K_M
框架
llama.cpp
版本
b4213
上下文长度
8192 tokens
批次大小
512
GPU 层数
99
Flash Attention
开启

硬件信息

标称与实测并排陈列,能否运行由读者自判

GPU
2x AMD Radeon RX 7900 XTX
标称显存
48 GB
实测显存(均值)
20.2 GB
系统
Linux 6.8.0
驱动
570.86.15
CUDA
12.6
电源功耗
462 W

来源与证据

共 1 条实测记录,逐条可回溯到原始出处

  1. L2 跨框架验证其他原始链接 验证于 2026-10-09

    b4213 · Linux 6.8.0 · CUDA 12.6 · 8192 ctx

    80 tok/s

    Decode

    948 tok/s

    Prefill

    1.36 s

    TTFT

    20.2 GB

    VRAM

    —

    MTP

    462 W

    功耗

    Auto-generated LLM-sourced record 2026-10-09. Model: Qwen3.5-27B, Hardware: RX 7900 XTX, Framework: 1, Quant: Q5_K_M.