返回搜索结果

Qwen3.5-4B · Q5_K_S

发起讨论
NVIDIA RTX 309024GBvLLM v0.46L2 跨框架验证

本页汇总 Qwen3.5-4B(Q5_K_S)在 NVIDIA RTX 3090 上以 vLLM 运行的 1 次实测数据,来自 1 个独立来源平台;指标为已上架实测的均值。

129.61 tok/s

Decode

解码速度

696.02 tok/s

Prefill

预填充速度

0.96 s

TTFT

首 token 延迟

9.66 GB

VRAM

显存占用

L2 跨框架验证

1

实测次数

1

独立来源

其他

来源平台

今天

最后验证

性能表现

  1. llama.cpp · Q5_K_S Decode 139.06 · Prefill 548.16 ·
  2. llama.cpp · Q6_K Decode 108.41 · Prefill 420.36 ·
  3. vLLM · Q5_K_S (当前)Decode 129.61 · Prefill 696.02 ·

核心数据

Decode(平均)
129.61 tok/s
Prefill(平均)
696.02 tok/s
TTFT(平均)
0.96 s
VRAM(平均)
9.66 GB
MTP 接受率
—
TTFB
1.04 GB
功耗
314.8 W

基础配置

成员级字段取自最近一次实测

模型
Qwen3.5-4B
量化方式
Q5_K_S
框架
vLLM
版本
v0.46
上下文长度
16384 tokens
批次大小
8
GPU 层数
999
Flash Attention
开启

硬件信息

标称与实测并排陈列,能否运行由读者自判

GPU
NVIDIA RTX 3090
标称显存
24 GB
实测显存(均值)
9.66 GB
系统
Ubuntu 24.04
驱动
560.94
CUDA
12.8
电源功耗
314.8 W

来源与证据

共 1 条实测记录,逐条可回溯到原始出处

  1. L2 跨框架验证其他原始链接 验证于 2026-10-10

    v0.46 · Ubuntu 24.04 · CUDA 12.8 · 16384 ctx

    129.61 tok/s

    Decode

    696.02 tok/s

    Prefill

    0.96 s

    TTFT

    9.66 GB

    VRAM

    —

    MTP

    314.8 W

    功耗

    L2 batch seed 2026-10-10: vLLM on hw_id=2 running model_id=48 at Q5_K_S