动态
ISTA-DASLab 发布 GSQ-RCO 量化家族:32GB RAM 也能跑 Qwen3.8-Flash-Next 180B
ISTA-DASLab 在 HuggingFace 发布 GSQ-RCO GGUF 量化家族:Q2_0 / IQ2_XS / IQ3_XXS / IQ3_S / Coder IQ1_M,权重从 32GB 到 83GB,覆盖从 32GB RAM 工作站到 128GB 内存服务器的不同档位。
是什么
ISTA-DASLab 在 HuggingFace 上线了 Qwen3.8-Flash-Next 的 GSQ-RCO GGUF 量化家族,覆盖从消费工作站到内存服务器的完整档位:
| 量化档 | 权重大小 | 最低 RAM | 推荐场景 |
|---|---|---|---|
| Coder (IQ1_M) | ~32 GB | 48 GB | 代码专用,速度优先 |
| IQ2_XS | ~45 GB | 64 GB | 推荐档——速度/质量平衡 |
| IQ3_XXS | ~76 GB | 96 GB | 质量敏感 |
| IQ3_S | ~83 GB | 128 GB | 接近全模型质量 |
| Q2_0 | ~66 GB | 96 GB | Q2_K 风格,CPU 友好 |
为什么发 GSQ-RCO 而不是普通 GGUF
GSQ 是 ISTA-DASLab 自研的分组缩放量化算法,结合 RCO(Row-Column Ordering,行列重排)后,对激活分布极端不均的 MoE 模型(Qwen3.8-Flash-Next 走 top-10 路由就是典型)效果尤其好。简单说:在 IQ2_XS 这个量级下,GSQ-RCO 比 vanilla GGUF IQ2_XS 质量更高、速度损失更小。
与 Strata 的搭配
GSQ-RCO GGUF 跟 Strata 0.1.38+ 完全兼容——Strata 直接消费 GGUF 文件,GSQ-RCO 不需要额外 patch。下载 GSQ-RCO IQ2_XS(45GB)后即可用 Strata 跑起来:
strata serve --model Qwen3.8-Flash-Next-GSQ-RCO-IQ2_XS.gguf \
--gpu-layers 12 --ctx 4096 --batch 1
选档建议
- 第一次试:IQ2_XS(45GB)——64GB RAM + 12GB 显卡的甜点
- 写代码为主:Coder IQ1_M(32GB)——48GB RAM 起步,速度反而最快(因为 sparse 路由更激进)
- 质量优先:IQ3_XXS(76GB)——96GB RAM,能跟 fp16 抗衡
- 极致质量:IQ3_S(83GB)——128GB RAM,基本等同于 bfloat16
本地部署角度
下载链接直接走 HuggingFace,仓库里有 SHA256 校验。建议先下 IQ2_XS 跑通流程,再按需换档。