资料定位

研究权重与激活联合4-bit量化,通过保留少量异常值的高精度计算和定制GPU内核提高端到端吞吐。

核心主题:端到端低位推理

论文不仅测量模型精度,还提供匹配量化格式的GPU内核并报告相对FP16的吞吐收益。

阅读与复现边界

异常值比例、GPU架构和内核实现都会改变收益,不能把单层算子速度当作整套服务速度。

对实际项目的用法

适合对比W4A4、仅权重量化和FP16基线,并在目标GPU上测量真实批量及延迟。

原文、署名与本地化说明

原文标题:QUIK: Towards End-to-end 4-Bit Inference on Generative Large Language Models。作者:Saleh Ashkboos 等。本站保存的是来源机构发布的完整PDF,未修改PDF内容;中文部分为独立阅读导引,不冒充全文翻译。原始出版页:https://aclanthology.org/2024.emnlp-main.197/。

许可依据:ACL Anthology官方版权政策说明:2016年及以后发布的ACL材料采用CC BY 4.0,明确允许复制、分发及在其他网站或媒介托管。 本站提供来源、许可证、文件哈希、页数和本地化时间,方便核对版本与完整性。

来源、翻译与版权说明

来源:ACL Anthology。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
EN
原文更新时间
2024-11-01
许可证
Creative Commons Attribution 4.0 International (CC BY 4.0)
文件校验
7fd88c4e4f27141c