当前位置: 首页 > news >正文

【llama.cpp】llama.cpp部署大模型

官方文档

https://github.com/ggml-org/llama.cpp

使用windows的编译exe

下载编译的文件

https://github.com/ggml-org/llama.cpp/releases

有GPU下载带cuda的

使用命令行工具llama-cli

解压文件后启动终端
输入以下查看可用的命令

llama-cli-h

启动模型

llama-cli.exe-mC:\xudawu\development\20260226_llamacpp_models\unsloth\Qwen3-4B-Thinking-2507-GGUF\Qwen3-4B-Thinking-2507-Q4_K_M.gguf-ngl100

-m指定模型位置,如果模型很大有多个gguf切片,只需要给出一个剩下的会自动索引
-ngl指定模型加载到GPU的层数


直接测试对话

测试性能llama-bench

使用llama-bench.exe工具测试此电脑的性能

llama-bench.exe-mC:\xudawu\development\20260226_llamacpp_models\unsloth\Qwen3-4B-Thinking-2507-GGUF\Qwen3-4B-Thinking-2507-Q4_K_M.gguf-ngl100

输入512token的速度,和输出128token的速度

启动模型服务llama-server

llama-server.exe-mC:\xudawu\development\20260226_llamacpp_models\unsloth\Qwen3-4B-Thinking-2507-GGUF\Qwen3-4B-Thinking-2507-Q4_K_M.gguf --ctx-size16384--host0.0.0.0--port8080

--ctx-size上下文长度,不设置则默认为0,从模型配置中加载上下文长度
--port端口,默认为8080
-a指定模型服务启动的名字,不设置则默认使用-m指定的文件名

启动成功

启动webui

进入指定的网址进入llama自带的web界面

启动多模态模型服务

下载视觉投影模型mmproj-BF16.gguf

启动模型服务

llama-server.exe-mmodels/Qwen3.5-35B-A3B-GGUF/Qwen3.5-35B-A3B-Q4_K_M.gguf--mmprojmodels/Qwen3.5-35B-A3B-GGUF/mmproj-BF16.gguf --ctx-size32768--host0.0.0.0--port8080

--mmproj models/Qwen3.5-35B-A3B-GGUF/mmproj-BF16.gguf指定multimodal projector的位置

获得所有模型

启动服务并指定模型文件夹地址

llama-server.exe --models-dir C:\xudawu\development\20260226_llamacpp_models\unsloth --sleep-idle-seconds180


通过get请求可以获得可用模型

以下参数在服务器空闲多少秒时卸载模型

--sleep-idle-seconds

推荐创建一个bat文件方便一键启动

bat文件内容如下
文件名
1a_start_llama_server.bat

llama-server.exe --models-dir../../models --ctx-size65536--host127.0.0.1--port8080

--ctx-size 65536设置模型上下文长度为65536token
--models-dir ../../models使用当前目录的上两级目录中的models文件夹作为模型文件夹
其余参数不设置由llama.cpp进行自适应调整

官方文档

https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md

使用docker

官方教程

https://github.com/ggml-org/llama.cpp/blob/master/docs/docker.md

选择这个镜像

启动容器服务

启动单个模型

dockerrun--namellama-server--gpusall-p8080:8080-vC:/xudawu/development/docker_data/llama_cpp/models:/models ghcr.io/ggml-org/llama.cpp:server-cuda-m/models/Qwen3.5-35B-A3B-Q4_K_M.gguf --ctx-size32768--host0.0.0.0--port8080

推荐使用--ctx-size 32768设置固定上下文长度
而使用-fitc 32768设置最小上下文长度,启动模型时会自动检测可用显存然后拓展上下文长度,会增加显存占用和减慢模型首次启动速度

启动服务,模型按需加载

dockerrun--namellama-server--gpusall-p8080:8080-vC:/xudawu/development/docker_data/llama_cpp/models:/models" ghcr.io/ggml-org/llama.cpp:server-cuda --models-dir /models --sleep-idle-seconds1800--ctx-size32768--host0.0.0.0--port8080

如果使用的是full-cuda的镜像

启动单个模型

dockerrun--namellama-server--gpusall-p8080:8080-vC:/xudawu/development/docker_data/llama_cpp/models:/models ghcr.io/ggml-org/llama.cpp:full-cuda--server-m/models/Qwen3.5-35B-A3B-Q4_K_M.gguf --ctx-size32768--host0.0.0.0--port8080

启动服务,模型按需加载

dockerrun--namellama-server--gpusall-p8080:8080-vC:/xudawu/development/docker_data/llama_cpp/models:/models ghcr.io/ggml-org/llama.cpp:full-cuda--server--models-dir /models --sleep-idle-seconds1800--ctx-size32768--host0.0.0.0--port8080

加载模型

POST /models/load

卸载模型

POST /models/unload
http://www.cnnetsun.cn/news/1862511.html

相关文章:

  • FireRedASR-AED-L保姆级教学:非AI工程师也能30分钟完成本地语音识别部署
  • CellProfiler:生物图像量化分析的模块化架构深度解析
  • HEIF Utility:Windows平台HEIF图像格式转换的终极解决方案
  • 5分钟开启音乐数字化之旅:Audiveris让纸质乐谱瞬间变数字宝藏
  • 告别psycopg的InterfaceError:深入理解Windows下asyncio的Selector与Proactor之争
  • wifi漫游(Roaming)802.11kvr 全协议梳理
  • 5分钟快速制作启动盘:EtchDroid安卓镜像写入工具完整指南
  • HDMI/DP/TypeC接口检测的硬件设计实战与避坑指南
  • 丹青识画在品牌联名活动中的应用:×茶饮品牌生成节气主题题跋
  • 为什么你的Stable Diffusion模型需要更安全的格式?
  • 浏览器中开启3D世界:零安装跨格式模型查看完整指南
  • Windows11下Gemini-cli环境配置全攻略:从零到成功运行
  • Nunchaku-flux-1-dev在STM32CubeMX配置中的应用:外设初始化代码生成
  • 实战指南:ACS 5.6安装与激活全流程解析
  • 全志T113-S3录音失真排查实录:从示波器到Cooledit Pro,我们踩了这些坑
  • WebSocket连接异常断开与EOFException:Nginx超时配置的深度解析
  • HsMod终极指南:BepInEx框架下的炉石传说全面定制解决方案
  • 通达信主副图与排序指标显示优化技巧
  • 150块的Astra相机,在Ubuntu 20.04 + ROS Noetic上跑起来有多香?保姆级避坑指南
  • Mac电池健康终极指南:使用Battery Toolkit延长Apple Silicon Mac电池寿命的完整教程
  • Qwen-Image-2512-Pixel-Art-LoRA 与MySQL结合:构建带历史记录的艺术图库管理系统
  • Typora 进阶指南:解锁 Markdown 高效写作的隐藏技巧
  • Java RPG Maker MV/MZ 解密器:终极免费解密工具使用指南
  • Creality Print完整指南:从入门到精通的3D打印切片软件教程
  • Python FastAPI 异步接口性能监控
  • NVIDIA Profile Inspector完整指南:4个步骤解锁显卡隐藏性能
  • ChatTTS技术突破:无标注数据下的语气预测能力
  • PXE启动失败?从DHCP Offer到TFTP超时的全链路排错指南
  • 数据结构--顺序表的插入、删除、查找详解
  • Python网易云音乐下载终极指南:3步轻松保存高品质音乐库