这份论文解决什么问题

大语言模型推理不仅受计算能力限制,更常被显存容量卡住。FlexGen研究的不是如何让模型勉强生成一个结果,而是当模型权重无法全部进入单张GPU时,怎样利用GPU显存、CPU内存和本地磁盘组成分层存储,在有限硬件上维持可用的批量吞吐。

核心方法

论文把模型权重、激活值和KV Cache分别建模,不再用一个固定的“全部卸载到CPU”策略处理所有数据。系统根据设备容量和带宽搜索放置比例与传输计划,并通过重叠计算和数据传输降低PCIe及磁盘I/O造成的等待。论文还讨论了4-bit权重量化与分层卸载结合后的容量收益。

阅读时重点关注

  • 表格中的吞吐量通常来自批量推理场景,不能直接等同于单用户首Token延迟。
  • GPU、CPU内存和SSD容量虽然可以扩大可运行模型规模,但PCIe带宽和磁盘顺序读写会成为新的瓶颈。
  • KV Cache随上下文长度和并发增长,部署时不能只按照权重大小计算容量。
  • 论文的设备、模型和软件版本属于实验时点,复现时应重新测量当前框架与硬件。

对实际部署的意义

FlexGen适合离线生成、批处理和硬件预算受限的实验环境。若目标是交互式在线服务,应同时测量首Token延迟、逐Token延迟和并发尾延迟,不能只采用论文中的吞吐结论。本站保留完整英文PDF,中文部分用于建立阅读路径,不替代原论文中的算法、实验设置和数据表。

署名与处理说明

作者:Ying Sheng、Lianmin Zheng、Binhang Yuan、Zhuohan Li、Max Ryabinin、Beidi Chen、Percy Liang、Christopher Ré、Ion Stoica、Ce Zhang。本站未修改原始PDF,仅将原文件镜像到本地以改善国内访问;中文文字为独立编写的阅读导引。原论文由PMLR发布,按CC BY 4.0许可再分发。

来源、翻译与版权说明

来源:Proceedings of Machine Learning Research (PMLR)。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
EN
原文更新时间
2023-07-23
许可证
Creative Commons Attribution 4.0 International (CC BY 4.0)
文件校验
7cd9673c37640011