← 新闻
动态

ISTA-DASLab 发布 GSQ-RCO 量化家族:32GB RAM 也能跑 Qwen3.8-Flash-Next 180B

ISTA-DASLab 在 HuggingFace 发布 GSQ-RCO GGUF 量化家族:Q2_0 / IQ2_XS / IQ3_XXS / IQ3_S / Coder IQ1_M,权重从 32GB 到 83GB,覆盖从 32GB RAM 工作站到 128GB 内存服务器的不同档位。

来源: HuggingFace ISTA-DASLab

是什么

ISTA-DASLab 在 HuggingFace 上线了 Qwen3.8-Flash-Next 的 GSQ-RCO GGUF 量化家族,覆盖从消费工作站到内存服务器的完整档位:

量化档 权重大小 最低 RAM 推荐场景
Coder (IQ1_M) ~32 GB 48 GB 代码专用,速度优先
IQ2_XS ~45 GB 64 GB 推荐档——速度/质量平衡
IQ3_XXS ~76 GB 96 GB 质量敏感
IQ3_S ~83 GB 128 GB 接近全模型质量
Q2_0 ~66 GB 96 GB Q2_K 风格,CPU 友好

为什么发 GSQ-RCO 而不是普通 GGUF

GSQ 是 ISTA-DASLab 自研的分组缩放量化算法,结合 RCO(Row-Column Ordering,行列重排)后,对激活分布极端不均的 MoE 模型(Qwen3.8-Flash-Next 走 top-10 路由就是典型)效果尤其好。简单说:在 IQ2_XS 这个量级下,GSQ-RCO 比 vanilla GGUF IQ2_XS 质量更高、速度损失更小。

与 Strata 的搭配

GSQ-RCO GGUF 跟 Strata 0.1.38+ 完全兼容——Strata 直接消费 GGUF 文件,GSQ-RCO 不需要额外 patch。下载 GSQ-RCO IQ2_XS(45GB)后即可用 Strata 跑起来:

strata serve --model Qwen3.8-Flash-Next-GSQ-RCO-IQ2_XS.gguf \
  --gpu-layers 12 --ctx 4096 --batch 1

选档建议

  • 第一次试:IQ2_XS(45GB)——64GB RAM + 12GB 显卡的甜点
  • 写代码为主:Coder IQ1_M(32GB)——48GB RAM 起步,速度反而最快(因为 sparse 路由更激进)
  • 质量优先:IQ3_XXS(76GB)——96GB RAM,能跟 fp16 抗衡
  • 极致质量:IQ3_S(83GB)——128GB RAM,基本等同于 bfloat16

本地部署角度

下载链接直接走 HuggingFace,仓库里有 SHA256 校验。建议先下 IQ2_XS 跑通流程,再按需换档。