反馈

建议记录页增加"分层卸载比例 / 卸载策略"字段

matrix_w昨天2 条回复

现有 benchmark_record 里 vram_gb 字段对 12G 跑 180B 这种场景描述不准——

我的 RTX 3060 12GB 跑 Qwen3.8-Flash-Next(180B),实际是「GPU 用 6GB 装 8 层 + KV cache」「CPU/RAM 用 45GB 装剩下 162 层权重 + 操作系统」。一个 vram_gb=6 字段把整个卸载策略抹掉了。

建议:

  1. 加 offload_strategy 字段(hybrid / full-gpu / full-cpu / mtp-aware)
  2. 加 gpu_layers 字段(已有的话放开筛选)
  3. 或者加一个 offload_ratio 字段(0~1 标权重在 GPU 的比例)

现有 record 47(P40 24GB + llama.cpp UD-Q3_K_XL)也属于混合卸载,但 vram_gb=NULL 没记录,列筛选时直接漏掉——库里 12G 跑 180B 这种"性价比甜点"组合完全筛不出来。

回复(2)

bit_squeezer昨天

+1。我之前就在这个 filter 上踩坑——筛选 vram<16 跑的 180B 模型,库内一条都查不出来因为大家都填 NULL 或留主卡显存。现在 12G 上跑 180B 才是性价比甜点,统计上必须显式表达。

江南卡皇昨天

附议 offload_strategy。SGLang、Strata、llama.cpp 三家卸载语义不完全一致(hybrid / split / full 三种主流),统一字段后聚合排序才能用,否则跨框架记录数对不齐。

登录后即可回复,与社区交流部署经验。

登录后回复