量化并不是统一降低位宽

不同层、通道和权重对模型输出的影响并不相同。全部采用同一低位宽虽然实现简单,却可能让少量敏感权重造成明显质量下降。SliM-LLM尝试根据显著性分配量化资源,使重要部分保留更高精度。

方法要点

论文建立显著性度量和混合精度分配方法,在给定平均位宽或容量预算下选择不同权重的精度,并针对大语言模型的规模约束设计可执行流程。实验比较困惑度、下游任务、模型容量和GPU推理表现。

读者需要核对的边界

  • “2-bit模型”通常指平均或主要权重位宽,不代表运行时所有数据都是2-bit。
  • 理论压缩倍数不等于GPU显存同比例下降,量化元数据、运行时缓存和反量化工作区仍占空间。
  • 能否加速取决于硬件和推理框架是否有对应高效算子。
  • 困惑度改善或保持不代表所有中文、代码和推理任务都无损。

如何用于选型

部署前应同时保存未量化基线,使用真实业务集比较质量、峰值显存、首Token时间和持续吞吐。若框架需要把低位权重还原到较高精度计算,容量可能降低但速度未必提高。

署名与处理说明

作者:Wei Huang、Haotong Qin、Yangdong Liu、Yawei Li、Qinshuo Liu、Xianglong Liu、Luca Benini、Michele Magno、Shiming Zhang、Xiaojuan Qi。本站镜像PMLR英文原始PDF,中文内容为独立阅读导引,不构成全文翻译。论文按CC BY 4.0许可再分发。

来源、翻译与版权说明

来源:Proceedings of Machine Learning Research (PMLR)。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
EN
原文更新时间
2025-07-13
许可证
Creative Commons Attribution 4.0 International (CC BY 4.0)
文件校验
9c3a22c56b3463f7