GLOBAL AI DOCUMENT INTELLIGENCE

AI技术文档与白皮书

持续追踪海外GPU、AI模型、推理框架和基础设施资料,通过中文导读、版本标记和本地原文帮助国内用户理解最新技术变化。

DOCUMENT CHANNELS

按资料类型浏览

集中查找模型、芯片、系统、标准和软件版本资料,并核对发布机构、更新时间与适用范围。

FEATURED READING

值得优先阅读的技术资料

  1. 大语言模型压缩技术综述系统了解量化、剪枝、蒸馏与低成本推理路线
  2. QUIK 4-bit 推理研究理解低比特量化如何影响显存、速度与模型精度
  3. NIST 生成式 AI 风险管理指南从治理、测量和管理角度建立生成式AI风险框架
  4. NIST AI 偏差识别与管理标准识别数据、模型和实际应用中的偏差来源
  5. 生成式 AI 安全开发实践把安全要求落实到模型和软件开发生命周期
DOCUMENT LIBRARY

最新收录资料

当前收录 20 份资料,可查看中文导读、资料出处,并在线阅读或下载允许本站保存的原始文件。

模型与AI研究报告原始文档可阅读

LLMQ:消费级GPU上的低精度大模型训练论文

论文给出面向消费级GPU的CUDA/C++低精度大模型训练实现,讨论激活检查点、卸载、通信和显存受限条件下3B至32B模型的训练设计。

来源:Proceedings of Machine Learning Research (PMLR)收录日期:2026-03-2320许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读

FloE:显存受限GPU上的MoE模型即时推理论文

面向专家混合模型在消费级GPU上部署的显存难题,论文提出按需处理专家参数的推理机制,并报告在RTX 3090等受限硬件上的容量、速度与精度权衡。

来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1324许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读

ShadowKV:长上下文大模型高吞吐推理的KV Cache优化论文

论文针对长上下文推理中KV Cache迅速占满GPU显存的问题,提出ShadowKV缓存组织方案,并从显存占用、解码延迟和端到端吞吐评估其效果。

来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1319许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读

SliM-LLM:大语言模型显著性驱动混合精度量化论文

论文研究如何依据权重显著性为大模型分配不同量化位宽,在降低显存和存储成本的同时控制精度损失,并给出2-bit等低位宽实验。

来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1321许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读

Ladder-Residual:通信重叠加速大模型并行推理

针对多GPU大模型推理中的通信等待,提出并行感知模型结构以重叠通信与计算。

来源:Proceedings of Machine Learning Research (PMLR)收录日期:2025-07-1314许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
标准、评测与AI安全原始文档可阅读

NIST生成式AI安全开发实践:基础模型软件供应链与生命周期指南

在NIST安全软件开发框架基础上补充生成式AI与双用途基础模型的安全实践,覆盖模型、数据、依赖、发布和持续监控。

来源:National Institute of Standards and Technology (NIST)收录日期:2024-07-2630许可:NIST Technical Series public-domain / worldwide republication grant
标准、评测与AI安全原始文档可阅读

NIST对抗性机器学习攻击与缓解措施分类体系

系统定义逃逸、投毒、隐私和滥用等对抗性机器学习攻击,以及相应缓解方法和术语。

来源:National Institute of Standards and Technology (NIST)收录日期:2024-01-01107许可:NIST Technical Series public-domain / worldwide republication grant
模型与AI研究报告原始文档可阅读

FlexGen:单张GPU实现大语言模型高吞吐推理的完整论文

论文系统解释如何通过GPU、CPU和磁盘三级内存协同,让超出单卡显存容量的大语言模型完成高吞吐批量推理,并分析权重、激活与KV Cache的放置和交换策略。

来源:Proceedings of Machine Learning Research (PMLR)收录日期:2023-07-2323许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
模型与AI研究报告原始文档可阅读

BPipe:大模型训练的显存均衡流水线并行方法

研究流水线并行训练中的阶段显存不均衡,通过重新分配保存的激活提高可用批量和训练效率。

来源:Proceedings of Machine Learning Research (PMLR)收录日期:2023-07-2315许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
标准、评测与AI安全原始文档可阅读

NIST人工智能偏差识别与管理标准:从数据、模型到实际使用环境

系统解释人工智能偏差如何在数据、模型、人员、组织和具体使用环境中形成,并给出识别、描述和治理偏差的共同框架。

来源:National Institute of Standards and Technology (NIST)收录日期:2022-03-1586许可:NIST Technical Series public-domain / worldwide republication grant
SOURCE & ACCESS

资料出处清楚,阅读方式明确

每份资料注明发布机构、原文标题、更新时间和许可信息;允许本站保存的文件可直接在线阅读和下载,其他资料提供中文导读与官方来源。

查看来源与版权说明 →