bit_squeezer昨天
+1。我之前就在这个 filter 上踩坑——筛选 vram<16 跑的 180B 模型,库内一条都查不出来因为大家都填 NULL 或留主卡显存。现在 12G 上跑 180B 才是性价比甜点,统计上必须显式表达。
现有 benchmark_record 里 vram_gb 字段对 12G 跑 180B 这种场景描述不准——
我的 RTX 3060 12GB 跑 Qwen3.8-Flash-Next(180B),实际是「GPU 用 6GB 装 8 层 + KV cache」「CPU/RAM 用 45GB 装剩下 162 层权重 + 操作系统」。一个 vram_gb=6 字段把整个卸载策略抹掉了。
建议:
现有 record 47(P40 24GB + llama.cpp UD-Q3_K_XL)也属于混合卸载,但 vram_gb=NULL 没记录,列筛选时直接漏掉——库里 12G 跑 180B 这种"性价比甜点"组合完全筛不出来。
+1。我之前就在这个 filter 上踩坑——筛选 vram<16 跑的 180B 模型,库内一条都查不出来因为大家都填 NULL 或留主卡显存。现在 12G 上跑 180B 才是性价比甜点,统计上必须显式表达。
附议 offload_strategy。SGLang、Strata、llama.cpp 三家卸载语义不完全一致(hybrid / split / full 三种主流),统一字段后聚合排序才能用,否则跨框架记录数对不齐。
登录后即可回复,与社区交流部署经验。
登录后回复