服务系统的核心矛盾
扩大批量通常可以提高GPU利用率,却可能让短请求等待长请求;追求最低单请求延迟又会造成算力空闲。生产调度器需要在服务等级目标、请求长度和缓存容量之间动态取舍。
阅读实验的方法
重点核对请求到达分布、输入输出长度、GPU型号、模型规模与基线配置。平均吞吐提升若伴随P99恶化,对交互服务未必有价值;反之,低负载的漂亮延迟也不能说明高峰容量。
项目应用
可据此设计压测矩阵:阶梯增加到达率,分别记录排队、prefill、decode和总耗时,并观察KV缓存占用、抢占次数与失败率。达到延迟目标的最大稳定吞吐才是更可比较的容量指标。
完整原文与使用说明
原文题名:Dovetail: A GPU-Efficient LLM Serving System。作者:EMNLP 2025论文作者。本站保存来源机构发布的完整英文PDF,PDF内容未作删改;上面的中文内容是针对这篇论文单独撰写的阅读导引,不冒充全文翻译。
原始发表页:https://aclanthology.org/2025.emnlp-main.879/。
许可依据:ACL Anthology官方版权政策说明:2016年及以后发布的材料采用CC BY 4.0,可在保留署名与出处的前提下复制和再分发。 本页同时展示文件页数、大小和哈希值,便于核对本地文件完整性。
来源:ACL Anthology。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- EN
- 原文更新时间
- 2025-11-01
- 许可证
- Creative Commons Attribution 4.0 International (CC BY 4.0)
- 文件校验
- 018080785d8553a2…




