Prism ML 发布的 27B 全三值(ternary)量化模型,基于 Qwen3.8-27B,架构未改:语言权重端到端取 {−1, 0, +1}(g128 分组 + FP16 组缩放,块状 Hadamard 旋转写入权重基),真实约 1.72 bit/权重,PTQ1_0 打包 5.95GB / PQ2_0 打包 7.21GB,约为 FP16 的 1/9.3。官方称保留 98.2% 的 FP16 智能水平(14 项 thinking 模式基准均分 84.78),继承 262K 上下文与约 75% 线性注意力的混合注意力骨干。需配合 Prism ML 的 llama.cpp 分支(CUDA / Metal / CPU)使用,另有 MLX 版本;视觉塔为可选 Q8_0 mmproj 包。Apache-2.0。
0
量化版本
2
实测记录
1
讨论数
量化版本
社区与官方发布的量化版本;「关联实测」只统计精确关联到该发布的实测记录。
还没有已收录的量化版本。
实测数据
共 2 组配置
| 硬件 | 框架 | 量化 | 生成速度 | 运行显存 | 实测次数 | 证据 |
|---|---|---|---|---|---|---|
| NVIDIA RTX 5060 Ti 16GB | llama.cpp | PTQ1_0 | 8.1 tok/s | — | 1 | L1 已复现 |
| NVIDIA RTX 3080 | llama.cpp | PTQ1_0 | 52.2 tok/s | 7.03 GB | 1 | L0 自报 |
其中 2 条实测未关联到具体量化版本,完整数据见搜索页。