Prefill与Decode要分开看

提示词预填充通常具有较高并行度,生成阶段则按Token串行推进。两者对计算、显存带宽和KV缓存的压力不同,把端到端平均速度作为唯一指标会掩盖瓶颈。

硬件感知意味着什么

方法设计必须考虑GPU的实际并行粒度、内存容量与数据移动,不能只比较理论操作数。并行切分若制造更多中间状态或同步,也可能在短请求上得不偿失。

适用测试

用短、中、长三档输入与输出组合测试,并分别统计prefill吞吐、首Token时间和decode速度。对多卡环境还需记录互联流量与扩展效率,确认收益没有转化为更差的P99延迟。

完整原文与使用说明

原文题名:Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration。作者:EMNLP 2025 Findings论文作者。本站保存来源机构发布的完整英文PDF,PDF内容未作删改;上面的中文内容是针对这篇论文单独撰写的阅读导引,不冒充全文翻译。

原始发表页:https://aclanthology.org/2025.findings-emnlp.120/。

许可依据:ACL Anthology官方版权政策说明:2016年及以后发布的材料采用CC BY 4.0,可在保留署名与出处的前提下复制和再分发。 本页同时展示文件页数、大小和哈希值,便于核对本地文件完整性。

来源、翻译与版权说明

来源:ACL Anthology。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
EN
原文更新时间
2025-11-01
许可证
Creative Commons Attribution 4.0 International (CC BY 4.0)
文件校验
c0eb9ff93a83d479