llama.cpp适合希望直接在本机运行GGUF模型、使用命令行对话,或启动本地兼容API的人。它不附带模型,也不替你判断模型许可证;程序、模型和硬件版本要分开选择。
安装前先看系统、硬件和空间
本文面向64位Windows电脑。官方发布页提供x64与arm64构建,下载时必须匹配处理器架构。
没有独立显卡可使用CPU构建;NVIDIA可查看CUDA构建,跨厂商显卡可查看Vulkan。具体兼容性以官方发布说明为准。
官方没有给所有模型统一最低值。内存需求主要取决于GGUF文件大小、上下文和后端;先从体积较小的量化模型测试。
至少预留程序、GGUF文件与临时下载空间。稳妥做法是让剩余空间不低于目标模型文件的约两倍;这是本站操作建议,不是官方硬门槛。
CPU、CUDA和Vulkan怎么选
- Windows x64(CPU):最适合第一次验证流程,不要求NVIDIA CUDA环境,但速度取决于CPU和模型大小。
- Windows x64(CUDA):面向支持的NVIDIA显卡。官方发布页可能同时列出不同CUDA主版本,并单独提供所需DLL包,必须按同一版本说明配套。
- Windows x64(Vulkan):可作为多种显卡的后端选择,实际支持情况取决于显卡驱动和设备。
- 其他构建:OpenVINO、SYCL、HIP和Windows arm64面向特定硬件,不确定时不要凭文件名混装。
下载官方程序并整理目录
- 打开llama.cpp官方Releases。
- 在最新正式发布中选择与你的Windows架构和硬件后端相符的压缩包。
- 解压到固定目录,例如
D:\AI\llama.cpp;不要直接在浏览器下载目录里长期运行。 - 另建模型目录,例如
D:\AI\models,把来源明确、许可证允许的.gguf文件放进去。 - 模型下载后核对发布者给出的文件大小或哈希;不运行来源不明的安装器和批处理文件。
用llama-cli运行GGUF模型
在llama.cpp解压目录打开PowerShell。官方README给出的基础方式是用-m指定GGUF文件:
.\llama-cli.exe -m "D:\AI\models\your-model.gguf"
带有内置聊天模板的模型通常会自动进入对话模式。如果没有,可先查看帮助,再按模型作者说明选择正确聊天模板。
.\llama-cli.exe --help .\llama-cli.exe -m "D:\AI\models\your-model.gguf" -cnv
启动本地网页和API
llama.cpp官方同时提供llama-server。它可启动本地Web界面,并提供兼容的聊天、响应与嵌入接口。基础启动示例:
.\llama-server.exe -m "D:\AI\models\your-model.gguf"
启动后按终端显示的本地地址访问。仅在本机使用时,不要随意把监听地址开放到公网;若需要局域网或公网访问,应先配置身份验证、防火墙和访问控制。
常见报错怎么排查
提示找不到文件
确认PowerShell当前目录中存在llama-cli.exe,模型路径加了引号,文件扩展名确实是.gguf,并检查Windows是否隐藏了真实扩展名。
模型加载失败或立即退出
先检查模型架构是否被当前版本支持、文件是否完整、内存是否足够。重新从模型官方发布页核对文件哈希,不要靠修改扩展名把其他格式伪装成GGUF。
显卡没有加速
确认下载的是对应后端构建,并更新官方显卡驱动。CUDA构建还要按发布页说明准备匹配版本的运行库;若无法确认环境,换CPU构建验证模型文件本身是否正常。
输出乱码或答非所问
检查终端编码、提示词语言、模型用途和聊天模板;基础模型与指令模型的使用方式不同。
更新、卸载与回滚
llama.cpp发布频繁。更新前保留旧程序目录,先用同一个GGUF和同一条测试提示验证新版本;确认正常后再删除旧目录。卸载时关闭所有llama进程,删除程序目录;模型独立存放时不会自动清理。
常见问题
必须使用NVIDIA显卡吗?
不必须。官方提供Windows CPU构建,也提供CUDA、Vulkan、OpenVINO、SYCL和HIP等构建。
能直接运行任意模型文件吗?
不能。主要运行兼容的GGUF模型;架构支持、聊天模板和模型许可证都要单独核对。
删除程序会自动删除模型吗?
不会。程序和GGUF通常分别保存,卸载时需要分别处理。
相关教程与官方来源
- 若更喜欢自动下载和管理模型,可对照Ollama Windows本地部署与模型管理教程。
- 需要图形化工作流与图像模型时,可阅读ComfyUI Windows本地部署教程。
- llama.cpp官方仓库与README
- llama.cpp官方Releases
- 官方本地构建说明
- 官方llama-server说明
- llama.cpp MIT许可证
核验日期:2026-07-16。本文未重新分发程序、模型或依赖;版本、资产名称和后端支持以官方发布页为准。