这份资料解决的问题
这篇研究围绕不同GPU的计算和显存特性,分析怎样组合资源并分配差异化请求。成本效率的前提是相同服务目标,而不是把最快卡和最便宜卡简单相加。可据此比较短交互、长文和离线批量队列,核算满足P95时延时的完成量、空闲资源与调度复杂度;实际租赁价格应使用当前报价。
原始研究资料
原文题名:Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs。
作者:Youhe Jiang、Fangcheng Fu、Xiaozhe Yao、Guoliang He、Xupeng Miao、Ana Klimovic、Bin Cui、Binhang Yuan等(完整署名见原文)。
原始发表入口:Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs。本页上方提供完整、未经删改的原始PDF,可在线阅读或直接下载。中文文字是独立导读,不冒充全文译文;实验设置、算法公式、消融结果和附录以完整PDF为准。
引用与许可
原始文献及本文引用请保留作者、题名、原发表机构与原文地址。原文采用CC BY 4.0许可,本地副本保留原有署名和出版信息。
来源:PMLR。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- EN
- 原文更新时间
- 2025-07-13
- 许可证
- CC BY 4.0
- 文件校验
- 96ad1e0595f83480…



