Ternary Bonsai 2 27B

27B对话由 Prism ML 发布 发起讨论

Prism ML 发布的 27B 全三值(ternary)量化模型,基于 Qwen3.8-27B,架构未改:语言权重端到端取 {−1, 0, +1}(g128 分组 + FP16 组缩放,块状 Hadamard 旋转写入权重基),真实约 1.72 bit/权重,PTQ1_0 打包 5.95GB / PQ2_0 打包 7.21GB,约为 FP16 的 1/9.3。官方称保留 98.2% 的 FP16 智能水平(14 项 thinking 模式基准均分 84.78),继承 262K 上下文与约 75% 线性注意力的混合注意力骨干。需配合 Prism ML 的 llama.cpp 分支(CUDA / Metal / CPU)使用,另有 MLX 版本;视觉塔为可选 Q8_0 mmproj 包。Apache-2.0。

0

量化版本

2

实测记录

1

讨论数

量化版本

社区与官方发布的量化版本;「关联实测」只统计精确关联到该发布的实测记录。

还没有已收录的量化版本。

实测数据

共 2 组配置

硬件框架量化生成速度运行显存实测次数证据
NVIDIA RTX 5060 Ti 16GBllama.cppPTQ1_08.1 tok/s—1L1 已复现
NVIDIA RTX 3080llama.cppPTQ1_052.2 tok/s7.03 GB1L0 自报

其中 2 条实测未关联到具体量化版本,完整数据见搜索页。

社区讨论

查看全部讨论