资料定位

系统比较大模型量化在知识能力、对齐表现和运行效率上的影响,并解释为什么减少显存不一定带来更快推理。

核心主题:量化评测

4-bit模型在多项任务中可接近全精度表现,但推理速度仍取决于硬件算子和工程实现。

阅读与复现边界

不能用困惑度单独代表所有下游任务,也不能把模型文件压缩率直接换算成GPU速度。

对实际项目的用法

用于制定量化模型验收表:质量、显存、首Token、逐Token吞吐和硬件支持必须同时测试。

原文、署名与本地化说明

原文标题:A Comprehensive Evaluation of Quantization Strategies for Large Language Models。作者:Renren Jin、Jiangcun Du、Wuwei Huang、Wei Liu、Jian Luan、Bin Wang、Deyi Xiong。本站保存的是来源机构发布的完整PDF,未修改PDF内容;中文部分为独立阅读导引,不冒充全文翻译。原始出版页:https://aclanthology.org/2024.findings-acl.726/。

许可依据:ACL Anthology官方版权政策说明:2016年及以后发布的ACL材料采用CC BY 4.0,明确允许复制、分发及在其他网站或媒介托管。 本站提供来源、许可证、文件哈希、页数和本地化时间,方便核对版本与完整性。

来源、翻译与版权说明

来源:ACL Anthology。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
EN
原文更新时间
2024-08-01
许可证
Creative Commons Attribution 4.0 International (CC BY 4.0)
文件校验
fdf89c38a93fd000