资料定位
分析大模型推理、服务负载和效率优化的能源影响,帮助把Token吞吐、硬件利用率与功耗放到同一评估框架。
核心主题:推理能耗
不同模型、批量、硬件与服务策略会改变每Token或每任务能耗,单看GPU额定功率无法判断效率。
阅读与复现边界
实验边界、电力结构和负载利用率会显著影响结论,不能跨数据中心直接套用单一能耗数字。
对实际项目的用法
部署验收应同步采集吞吐、延迟、GPU功率、整机功率和任务质量,计算每个有效结果的能源成本。
原文、署名与本地化说明
原文标题:Energy Considerations of Large Language Model Inference and Efficiency。作者:ACL 2025论文作者。本站保存的是来源机构发布的完整PDF,未修改PDF内容;中文部分为独立阅读导引,不冒充全文翻译。原始出版页:https://aclanthology.org/2025.acl-long.1563/。
许可依据:ACL Anthology官方版权政策说明:2016年及以后发布的ACL材料采用CC BY 4.0,明确允许复制、分发及在其他网站或媒介托管。 本站提供来源、许可证、文件哈希、页数和本地化时间,方便核对版本与完整性。
来源:ACL Anthology。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- EN
- 原文更新时间
- 2025-07-01
- 许可证
- Creative Commons Attribution 4.0 International (CC BY 4.0)
- 文件校验
- df59ebf314c7e807…




