← 返回AI算力选型库

SOFTWARE SELECTION PROFILE

llama.cpp

以C/C++实现的轻量大模型推理项目,适合GGUF量化、CPU和消费级设备本地部署。
资料更新:2026-07-24官方资料来源 →

核心规格

厂商/维护方
ggml-org
许可证
MIT
软件类型
轻量本地推理
相关组件
GGUF、llama-server、Metal、CUDA、Vulkan
操作系统
Linux、Windows、macOS
支持硬件
CPU、NVIDIA GPU、AMD GPU、Apple Silicon、多种异构后端

软件与部署生态

软件兼容信息正在补充。

部署与采购注意事项

  • 量化等级同时影响容量、速度与质量
  • GPU卸载层数、上下文和KV Cache格式需要联合调优

不适合或需要谨慎的场景

  • 需要极高并发的多租户集群
  • 不支持转换为GGUF的模型
HOW TO USE THIS PROFILE

不要用单个参数直接作出采购决定

权重显存只是部署下限。真实服务还需要预留KV Cache、批处理、上下文、框架运行开销和安全余量;MoE模型的激活参数也不能代替完整权重容量。

WANGYU COMPUTE SERVICE

让网昱继续核对这份算力方案

结合模型、并发、硬件平台、预算和交付条件,进一步确认配置边界,或匹配可租算力资源。