将训练后三值化扩展至 Qwen3-8B:能力保留、复现、无损打包与打包执行
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
arXiv:2609.09240v1 交叉公告。超低位宽语言模型有望降低存储与内存流量,但标称的“1.58 比特”并不说明实际部署表示及其执行开销。该研究把一套激进的后训练转换流程从 Qwen3-4B 扩展到 Qwen3-8B,流程包含 KOTMS 旋转、E2M-ATQ 自适应三值化以及仅权重量化 A16 配置下的 GPTQ 式误差补偿,作者不主张这些算法为原创,贡献在于端到端扩展性刻画:外部复现门槛、匹配的 4B/8B 能力分析、跨语料困惑度、有效比特核算、无损格感知打包与直接打包执行。8B 模型三语料困惑度比为 1.361 倍,WikiText-2、C4、PTB 分别为 1.318 倍、1.393 倍、1.371 倍;在 8 个零样本任务(n=500)上平均准确率 64.6%,FP16 为 72.4%,对应 78.5% 的随机校正保留率与 7.8 个百分点的绝对损失;匹配的 4B 运行保留 69.6%,8B 领先 8.9 个百分点。打包检查点为 8.24 GiB,并在测量精度内保持原有困惑度;直接打包执行在 7.35 GiB 下达到 15.52 tokens/s,但初步打包 GEMV 仍慢于 FP16 cuBLAS。结论是给出了经验证的扩展基线,而更广泛的随机种子、校准分布与内核优化仍有待研究。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究目标
把一套激进的后训练超低位转换流水线从 Qwen3-4B 扩展到 Qwen3-8B,并给出端到端的规模扩展刻画。
核心质疑
名义上的“1.58 比特”标签并不能说明实际部署的表示形式,也不能说明其执行成本。
转换方法
在仅权重的 A16 配置下,使用 KOTMS 旋转、E2M-ATQ 自适应三值化和 GPTQ 式误差补偿;作者不主张这些算法为新的。
贡献定位
贡献在于规模扩展表征:外部复现门、匹配的 4B/8B 能力分析、跨语料困惑度、有效位核算、无损格感知打包与直接打包执行。
困惑度结果
8B 模型三语料困惑度比为 1.361 倍,其中 WikiText-2 为 1.318 倍、C4 为 1.393 倍、PTB 为 1.371 倍。
零样本能力
八项零样本任务在 n = 500 时平均准确率为 64.6%,FP16 为 72.4%,即机会校正保留率 78.5%,绝对代价 7.8 个百分点。
规模对比
匹配的 4B 运行保留 69.6%,由此得到 8B 相对 4B 的 8.9 个百分点优势。
打包与执行
打包检查点为 8.24 GiB,并在测量精度内保持记录的困惑度;直接打包执行达到每秒 15.52 个词元、占用 7.35 GiB。
执行局限
初步的打包 GEMV 仍慢于 FP16 cuBLAS。
结论与开放问题
结果构成经过验证的规模扩展基线:模型规模提升了对激进后训练离散化的鲁棒性,序列化问题在已测量产物上得到解决,直接执行可行;更广的随机种子、校准分布与内核优化仍待研究。