资料定位
面向需要继续微调的大模型,研究量化、参数高效微调、硬件兼容性与部署速度之间的综合平衡。
核心主题:量化微调
方法目标不是单纯降低训练显存,而是同时维持模型质量、微调速度和部署后的推理性能。
阅读与复现边界
微调数据规模、基础模型、量化位宽和GPU算子会影响结果,论文平均指标不能替代业务任务复测。
对实际项目的用法
可作为QLoRA等方案的对照,记录训练峰值显存、每步耗时、合并后模型大小和部署吞吐。
原文、署名与本地化说明
原文标题:QEFT: Quantization for Efficient Fine-Tuning of LLMs。作者:Changhun Lee、Jun-gyu Jin、YoungHyun Cho、Eunhyeok Park。本站保存的是来源机构发布的完整PDF,未修改PDF内容;中文部分为独立阅读导引,不冒充全文翻译。原始出版页:https://aclanthology.org/2024.findings-emnlp.811/。
许可依据:ACL Anthology官方版权政策说明:2016年及以后发布的ACL材料采用CC BY 4.0,明确允许复制、分发及在其他网站或媒介托管。 本站提供来源、许可证、文件哈希、页数和本地化时间,方便核对版本与完整性。
来源:ACL Anthology。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- EN
- 原文更新时间
- 2024-11-01
- 许可证
- Creative Commons Attribution 4.0 International (CC BY 4.0)
- 文件校验
- cdf944c8d419425e…




