- 社区热度
- 124.8k Stars
- GitHub 收藏
- 最近活跃
- 2026/8/20
- 近 30 天还在更新
- 授权协议
- MIT
- 宽松协议
为什么值得关注
不是看 Star 排名,而是看它解决了什么问题、实际有没有用,以及方法为什么值得关注。
解决的问题
解决了在本地和各类硬件(如 Apple Silicon、各类 GPU 及 CPU)上运行大语言模型(LLM)与多模态模型(VLM)时对复杂环境和外部依赖的依赖问题。
实际价值
提供了纯 C/C++ 实现、多种量化方案(1.5-bit 到 8-bit)、支持 CPU 与 GPU 混合推理及多种后端(CUDA、Metal、Vulkan 等),用户可以通过 CLI 或内置 Web UI 的 OpenAI 兼容 API 服务器直接运行模型。
创新 / 差异化
基于 ggml 库构建,通过广泛的硬件架构优化(如 ARM NEON、AVX、RISC-V 向量扩展)和自定义硬件内核,实现了无外部依赖的跨平台模型推理。
扩展潜力
支持 Docker、预编译二进制文件和从源码构建,并可作为库集成或通过命令行与 API 服务嵌入到其他本地和云端应用中。
为什么是现在
随着本地大模型部署和多模态交互需求的普及,该项目提供了跨硬件的高效推理方案。
社区活跃度
近 90 天新增 1291 个 Issue、2288 个 PR;窗口内抽取的 Issue/PR 样本中有 87 位 Issue 发起者、65 位 PR 贡献者,并发布 至少 50 个版本。
维护者响应
窗口内 100 个 Issue 样本关闭率 93%,100 个 PR 样本合并率 51%。维护者评论样本仅覆盖该 Issue 样本的 8%,不足以可靠判断首次响应率与响应速度。
核心亮点
- 纯 C/C++ 实现,无外部依赖
- 支持 1.5-bit 到 8-bit 的多种量化格式
- 广泛的硬件后端支持(CUDA, Metal, Vulkan, SYCL 等)
快速开始
安装方式、上手难度、开始步骤。
装在哪
本地运行
难不难
中等,需要一点配置
- 01通过源码编译或下载预构建二进制文件安装 llama.cpp。
- 02使用命令行工具运行 Hugging Face 上的 GGUF 模型。
- 03启动内置服务器以提供 OpenAI 兼容的 API 接口。
更适合谁
- 希望数据放在自己服务器上的团队
- 想在本机直接跑起来试用的开发者
- 习惯用 Docker 部署的人
更多介绍
llama.cpp 是一个高性能的 LLM 和 VLM 推理引擎,通过极简的设置在各类硬件上运行大模型。它基于 ggml 库构建,通过针对不同架构(如 Apple Silicon 的 Metal、NVIDIA 的 CUDA)的深度优化,实现了高效的推理性能。
该项目支持多种量化技术,能减少内存占用并提升推理速度。用户可以通过命令行工具直接运行模型,或启动内置的 HTTP 服务以集成到现有应用中。
信息来源
每条信息都标注了状态与出处,可展开查看。
15 条 · 展开
信息来源
每条信息都标注了状态与出处,可展开查看。
capability tags
已核验ai_coding、automation
来源: admin_cms · cms editor · 2026/8/21
editor note
已核验{"en":"This project serves as a foundation for running LLMs locally, implemented in pure C/C++ with minimal dependencies. It is suitable for developers deploying models on consumer hardware or edge devices.","zh":"该项目是本地运行大模型的基石,通过纯 C/C++ 实现,几乎不依赖外部库。适合需要将模型部署在消费级硬件或边缘设备上的开发者。"}
来源: admin_cms · cms editor · 2026/8/21
how to use
已核验{"steps":[{"en":"Install llama.cpp by building from source or downloading pre-built binaries.","zh":"通过源码编译或下载预构建二进制文件安装 llama.cpp。"},{"en":"Run a GGUF model from Hugging Face using the CLI tool.","zh":"使用命令行工具运行 Hugging Face 上的 GGUF 模型。"},{"en":"Launch the built-in server to provide an OpenAI-compatible API interface.","zh":"启动内置服务器以提供 OpenAI 兼容的 API 接口。"}],"installAt":"local","difficulty":"medium"}
来源: admin_cms · cms editor · 2026/8/21
intro
已核验{"en":"llama.cpp is a high-performance inference engine for LLMs and VLMs, designed to run models on diverse hardware with minimal setup. Built on the ggml library, it achieves efficient performance through deep optimizations for specific architectures, including Metal for Apple Silicon and CUDA for NVIDIA GPUs.\n\nThe project supports various quantization techniques to reduce memory footprint and increase inference speed. Users can run models directly via CLI tools or launch the built-in HTTP server for integration into existing applications.","zh":"llama.cpp 是一个高性能的 LLM 和 VLM 推理引擎,通过极简的设置在各类硬件上运行大模型。它基于 ggml 库构建,通过针对不同架构(如 Apple Silicon 的 Metal、NVIDIA 的 CUDA)的深度优化,实现了高效的推理性能。\n\n该项目支持多种量化技术,能减少内存占用并提升推理速度。用户可以通过命令行工具直接运行模型,或启动内置的 HTTP 服务以集成到现有应用中。"}
来源: admin_cms · cms editor · 2026/8/21
最新版本
已核验b10507
来源: GitHub 官方接口 · latest_release=b10507 · 2026/8/20
许可证
已核验MIT
来源: GitHub 官方接口 · license.spdx_id=MIT · 2026/8/20
needs api key
已核验否
来源: admin_cms · cms editor · 2026/8/21
一句话用途
已核验{"en":"A lightweight LLM inference engine implemented in C/C++, supporting various hardware backends and model quantization.","zh":"基于 C/C++ 实现的轻量级大语言模型推理引擎,支持多种硬件加速与模型量化。"}
来源: admin_cms · cms editor · 2026/8/21
平台
已核验windows、macos、linux、android、browser
来源: admin_cms · cms editor · 2026/8/21
分类线索
根据材料推断ai-apps
来源: 项目说明文档 · hint=ai-apps · 2026/8/20
product forms
已核验cli、library_framework
来源: admin_cms · cms editor · 2026/8/21
role tags
已核验backend、devops
来源: admin_cms · cms editor · 2026/8/21
supports docker
已核验是
来源: admin_cms · cms editor · 2026/8/21
supports local
已核验是
来源: admin_cms · cms editor · 2026/8/21
supports self host
已核验是
来源: admin_cms · cms editor · 2026/8/21
相关项目
根据分类、能力和适用角色匹配的其他已核验项目。
claude-code
运行在终端中的 Agent 编程工具,可理解代码库、执行日常开发任务、解释代码并处理 Git 工作流。
spec-kit
一套遵循「规范驱动开发」流程的开源 CLI 工具包,配合 AI 编程 Agent 按照规范生成与执行代码。
codex
运行在本机的 OpenAI 编程 Agent,可通过终端使用,也提供 IDE 和桌面应用入口。
CLI-Anything
为现有软件生成和管理 Agent 可调用 CLI 的工具集,包含 CLI-Hub、生成流程与 SKILL/插件接入方式。
playwright
支持 Chromium、Firefox 和 WebKit 的跨浏览器自动化测试与 AI 代理控制框架。
codebase-memory-mcp
高性能代码库知识图谱 MCP 服务器,通过本地持久化索引实现毫秒级代码结构查询与分析。

