模型与AI研究报告原始文档可阅读
论文给出面向消费级GPU的CUDA/C++低精度大模型训练实现,讨论激活检查点、卸载、通信和显存受限条件下3B至32B模型的训练设计。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2026-03-2320 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
面向专家混合模型在消费级GPU上部署的显存难题,论文提出按需处理专家参数的推理机制,并报告在RTX 3090等受限硬件上的容量、速度与精度权衡。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1324 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
论文针对长上下文推理中KV Cache迅速占满GPU显存的问题,提出ShadowKV缓存组织方案,并从显存占用、解码延迟和端到端吞吐评估其效果。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1319 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
论文研究如何依据权重显著性为大模型分配不同量化位宽,在降低显存和存储成本的同时控制精度损失,并给出2-bit等低位宽实验。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1321 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
针对多GPU大模型推理中的通信等待,提出并行感知模型结构以重叠通信与计算。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1314 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
研究利用GPU加速全同态加密执行隐私保护的大模型推理,评估密码计算、模型结构和性能开销。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1312 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
分析大模型推理、服务负载和效率优化的能源影响,帮助把Token吞吐、硬件利用率与功耗放到同一评估框架。
来源:ACL Anthology收录日期:2025-07-0114 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
系统梳理大模型量化、剪枝、知识蒸馏和低秩分解,适合作为模型压缩技术路线的总览索引。
来源:ACL Anthology收录日期:2024-12-0122 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
研究权重与激活联合4-bit量化,通过保留少量异常值的高精度计算和定制GPU内核提高端到端吞吐。
来源:ACL Anthology收录日期:2024-11-0117 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
面向需要继续微调的大模型,研究量化、参数高效微调、硬件兼容性与部署速度之间的综合平衡。
来源:ACL Anthology收录日期:2024-11-0115 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
讨论无需完整模型重训的训练后量化,重点处理低位表示中的异常值和不同层的量化敏感性。
来源:ACL Anthology收录日期:2024-08-0116 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
系统比较大模型量化在知识能力、对齐表现和运行效率上的影响,并解释为什么减少显存不一定带来更快推理。
来源:ACL Anthology收录日期:2024-08-0130 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
标准、评测与AI安全原始文档可阅读
在NIST安全软件开发框架基础上补充生成式AI与双用途基础模型的安全实践,覆盖模型、数据、依赖、发布和持续监控。
来源:National Institute of Standards and Technology (NIST)收录日期:2024-07-2630 页许可:NIST Technical Series public-domain / worldwide republication grant
标准、评测与AI安全原始文档可阅读
针对生成式AI补充内容真实性、信息安全、隐私、偏见、知识产权和人机交互等风险及建议措施。
来源:National Institute of Standards and Technology (NIST)收录日期:2024-07-2664 页许可:NIST Technical Series public-domain / worldwide republication grant
标准、评测与AI安全原始文档可阅读
系统定义逃逸、投毒、隐私和滥用等对抗性机器学习攻击,以及相应缓解方法和术语。
来源:National Institute of Standards and Technology (NIST)收录日期:2024-01-01107 页许可:NIST Technical Series public-domain / worldwide republication grant
模型与AI研究报告原始文档可阅读
论文系统讨论参数化知识与显式知识图谱的互补关系,分析大模型知识更新、可解释性、事实一致性和混合系统的研究方向。
来源:CEUR Workshop Proceedings收录日期:2023-08-1130 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
论文系统解释如何通过GPU、CPU和磁盘三级内存协同,让超出单卡显存容量的大语言模型完成高吞吐批量推理,并分析权重、激活与KV Cache的放置和交换策略。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2023-07-2323 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读
研究流水线并行训练中的阶段显存不均衡,通过重新分配保存的激活提高可用批量和训练效率。
来源:Proceedings of Machine Learning Research (PMLR)收录日期:2023-07-2315 页许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
标准、评测与AI安全原始文档可阅读
NIST AI RMF 1.0提供Govern、Map、Measure、Manage四类核心职能,用于组织可信AI风险治理和生命周期管理。
来源:National Institute of Standards and Technology (NIST)收录日期:2023-01-2648 页许可:NIST Technical Series public-domain / worldwide republication grant
标准、评测与AI安全原始文档可阅读
系统解释人工智能偏差如何在数据、模型、人员、组织和具体使用环境中形成,并给出识别、描述和治理偏差的共同框架。
来源:National Institute of Standards and Technology (NIST)收录日期:2022-03-1586 页许可:NIST Technical Series public-domain / worldwide republication grant