llama.cpp Windows运行GGUF模型教程

依据llama.cpp官方文档整理Windows运行GGUF模型、CPU/CUDA/Vulkan版本选择、llama-cli对话、本地llama-server、卸载与常见报错排查。

本地 AI · 官方资料核验于 2026-07-16

llama.cpp适合希望直接在本机运行GGUF模型、使用命令行对话,或启动本地兼容API的人。它不附带模型,也不替你判断模型许可证;程序、模型和硬件版本要分开选择。

本文不提供二次打包:只使用llama.cpp官方GitHub发布页和官方文档。项目代码采用MIT许可证,但你下载的GGUF模型有自己的许可证、使用限制与来源,不能把“程序开源”理解成“所有模型都能商用”。

安装前先看系统、硬件和空间

适用系统
本文面向64位Windows电脑。官方发布页提供x64与arm64构建,下载时必须匹配处理器架构。
处理器与显卡
没有独立显卡可使用CPU构建;NVIDIA可查看CUDA构建,跨厂商显卡可查看Vulkan。具体兼容性以官方发布说明为准。
内存
官方没有给所有模型统一最低值。内存需求主要取决于GGUF文件大小、上下文和后端;先从体积较小的量化模型测试。
磁盘
至少预留程序、GGUF文件与临时下载空间。稳妥做法是让剩余空间不低于目标模型文件的约两倍;这是本站操作建议,不是官方硬门槛。

CPU、CUDA和Vulkan怎么选

  • Windows x64(CPU):最适合第一次验证流程,不要求NVIDIA CUDA环境,但速度取决于CPU和模型大小。
  • Windows x64(CUDA):面向支持的NVIDIA显卡。官方发布页可能同时列出不同CUDA主版本,并单独提供所需DLL包,必须按同一版本说明配套。
  • Windows x64(Vulkan):可作为多种显卡的后端选择,实际支持情况取决于显卡驱动和设备。
  • 其他构建:OpenVINO、SYCL、HIP和Windows arm64面向特定硬件,不确定时不要凭文件名混装。

下载官方程序并整理目录

  1. 打开llama.cpp官方Releases
  2. 在最新正式发布中选择与你的Windows架构和硬件后端相符的压缩包。
  3. 解压到固定目录,例如D:\AI\llama.cpp;不要直接在浏览器下载目录里长期运行。
  4. 另建模型目录,例如D:\AI\models,把来源明确、许可证允许的.gguf文件放进去。
  5. 模型下载后核对发布者给出的文件大小或哈希;不运行来源不明的安装器和批处理文件。

用llama-cli运行GGUF模型

在llama.cpp解压目录打开PowerShell。官方README给出的基础方式是用-m指定GGUF文件:

.\llama-cli.exe -m "D:\AI\models\your-model.gguf"

带有内置聊天模板的模型通常会自动进入对话模式。如果没有,可先查看帮助,再按模型作者说明选择正确聊天模板。

.\llama-cli.exe --help
.\llama-cli.exe -m "D:\AI\models\your-model.gguf" -cnv

启动本地网页和API

llama.cpp官方同时提供llama-server。它可启动本地Web界面,并提供兼容的聊天、响应与嵌入接口。基础启动示例:

.\llama-server.exe -m "D:\AI\models\your-model.gguf"

启动后按终端显示的本地地址访问。仅在本机使用时,不要随意把监听地址开放到公网;若需要局域网或公网访问,应先配置身份验证、防火墙和访问控制。

常见报错怎么排查

提示找不到文件

确认PowerShell当前目录中存在llama-cli.exe,模型路径加了引号,文件扩展名确实是.gguf,并检查Windows是否隐藏了真实扩展名。

模型加载失败或立即退出

先检查模型架构是否被当前版本支持、文件是否完整、内存是否足够。重新从模型官方发布页核对文件哈希,不要靠修改扩展名把其他格式伪装成GGUF。

显卡没有加速

确认下载的是对应后端构建,并更新官方显卡驱动。CUDA构建还要按发布页说明准备匹配版本的运行库;若无法确认环境,换CPU构建验证模型文件本身是否正常。

输出乱码或答非所问

检查终端编码、提示词语言、模型用途和聊天模板;基础模型与指令模型的使用方式不同。

更新、卸载与回滚

llama.cpp发布频繁。更新前保留旧程序目录,先用同一个GGUF和同一条测试提示验证新版本;确认正常后再删除旧目录。卸载时关闭所有llama进程,删除程序目录;模型独立存放时不会自动清理。

安全提示:不要运行要求关闭杀毒软件、提供Token、Cookie、钱包私钥或远程控制权限的“模型启动器”。模型文件也可能包含许可证限制;涉及客户资料时,先确认数据确实只在本机流转。

常见问题

必须使用NVIDIA显卡吗?

不必须。官方提供Windows CPU构建,也提供CUDA、Vulkan、OpenVINO、SYCL和HIP等构建。

能直接运行任意模型文件吗?

不能。主要运行兼容的GGUF模型;架构支持、聊天模板和模型许可证都要单独核对。

删除程序会自动删除模型吗?

不会。程序和GGUF通常分别保存,卸载时需要分别处理。

相关教程与官方来源

核验日期:2026-07-16。本文未重新分发程序、模型或依赖;版本、资产名称和后端支持以官方发布页为准。

说明:本文用于介绍产品功能、订阅管理或操作流程,不代表相关品牌的官方承诺。产品名称、价格、功能和政策可能变化,请以对应官方页面的最新信息为准。