当前位置: 首页 > news >正文

【AI】本地大模型搭建-1 KoboldCpp

文章目录

  • 本地大模型搭建全流程(RTX 5060 + Ubuntu + KoboldCpp)
    • 一、整体架构
    • 二、环境信息
    • 三、网络验证(已完成 ✅)
      • 验证命令
      • 实测结果
      • ⚠️ 注意事项
    • 四、踩坑记录
      • 4.1 UI 白屏 ≠ 模型没启动
    • 五、安装 KoboldCpp
    • 六、下载 GGUF 模型
      • 量化版本对比(8GB 显存视角)
    • 七、KoboldCpp 参数配置(v1.118.1 实测)
      • 参数表
      • 启动步骤(按顺序,一层验证完再进下一层)
    • 八、停止 / 卸载模型(释放显存)
      • 8.1 KoboldCpp(本次实际使用方式)
      • 8.2 关掉终端后显存仍未释放
      • 8.3 如果用的是 Ollama(备选)
    • 九、性能记录与后续调优
      • 实测数据
      • 结论
      • 下一步调优方向

本地大模型搭建全流程(RTX 5060 + Ubuntu + KoboldCpp)

与 AI 协作搭建本地大模型的完整记录,已按主题整理。
环境:Windows 11 + RTX 5060 Laptop 8GB + VMware Ubuntu + KoboldCpp

一、整体架构

核心思路:模型推理放在 Windows(GPU 直通),Ubuntu 虚拟机作为远程客户端,两者通过 VMware VMnet8 跨网络访问。

Windows 11 ├── RTX 5060 Laptop 8GB │ └── KoboldCpp(GPU 推理引擎) │ └── HTTP API 0.0.0.0:5001 │ └── VMnet8 网卡(192.168.107.1) │ VMware NAT 网关(192.168.107.2) ▼ Ubuntu VM(192.168.107.195) └── 远程访问测试(curl / wget)

数据流(已全部验证打通 ✅):

Ubuntu VM(192.168.107.195) → VMware NAT → Windows(192.168.107.1) → KoboldCpp → RTX 5060

要点:

  • 不需要改动 VMware 网络架构——Windows 在 VMnet8 上有明确 IP(192.168.107.1),直接用 IP 访问即可。
  • Windows 上的 KoboldCpp 必须监听0.0.0.0(不能只监听127.0.0.1),并放行防火墙,否则 Ubuntu 访问不到。
  • 这个案例本身就是"跨虚拟网络访问宿主机服务"的典型实验:Ubuntu → 路由 → VMware NAT → Windows。

二、环境信息

项目
宿主机Windows 11
GPURTX 5060 Laptop,显存 8151 MiB ≈ 8GB
内存32GB
硬盘3TB
NVIDIA 驱动610.74
CUDA Driver13.3(UMD),无需安装 CUDA Toolkit
Ubuntu VM192.168.107.195/24,网关 192.168.107.2(VMware NAT)
Windows VMnet8192.168.107.1

三、网络验证(已完成 ✅)

目标链路:Ubuntu → VMware NAT → Windows VMnet8,最终到 Windows 上的推理引擎。

验证命令

# 1. Ubuntu 里 ping Windows 虚拟网卡ping-c4192.168.107.1# 2. Windows CMD 确认 VMnet8 地址ipconfig# 找 VMware Network Adapter VMnet8 → 192.168.107.1# 3. 验证 HTTP 层(Windows 先启动临时服务)# Windows PowerShell:python-mhttp.server8080--bind0.0.0.0# Ubuntu 里:wget-O- http://192.168.107.1:8080# 或 curl

实测结果

  • Ubuntu ping192.168.107.1:4/4 通过,0% 丢包,延迟约 0.5ms,链路完全打通。

⚠️ 注意事项

  • ICMP 通 ≠ TCP 端口通:Windows 防火墙可能放行 ping 但拦截具体端口。
  • 若 HTTP 测试失败,依次检查:防火墙 → 监听地址 → 监听端口 → VMnet8 → 虚拟网络。

四、踩坑记录

4.1 UI 白屏 ≠ 模型没启动

  • 白屏可能只是浏览器 UI 问题,模型可能已正常加载到 GPU、后端正常。
  • 不要为了白屏反复双击 launch:每启动一次就会再加载一个模型进显存,多次之后 8GB 显存瞬间被占满。
  • 判断方法:看启动终端输出 +nvidia-smi显存占用。

五、安装 KoboldCpp

  • 下载地址:KoboldCpp 官方 GitHub →Releases→ Windows 的 CUDA 版本。
  • 版本选择:驱动已是CUDA 13.3,优先选 CUDA 13 版(如koboldcpp_cu13.exe),不必迁就旧 CUDA。
  • 本次实际版本:KoboldCpp v1.118.1,启动后正确识别 RTX 5060 Laptop GPU。

六、下载 GGUF 模型

第一轮只做环境验证,用Qwen3-8B Q4_K_M(约 5.03GB),不要一上来就下大模型。

  • 下载地址:Qwen/Qwen3-8B-GGUF(Hugging Face)
  • 文件:Qwen3-8B-Q4_K_M.gguf
  • 存放目录:D:\AI\Models\

量化版本对比(8GB 显存视角)

版本大小评价
Q4_K_M5.03 GB★★★★★ 最稳,第一轮首选
Q5_K_M5.85 GB★★★★☆ 可跑,但更吃显存
Q6_K6.73 GB★★★☆☆ 逼近显存极限
Q8_08.71 GB❌ 文件已超 8GB 显存,第一轮不要

提示:Qwen3-8B 只是"点火塞"。跑通链路后,如需更强的对话/推理能力,建议换 12B/14B 更大模型(Q4/Q5 量化),而不是一直用 8B。

七、KoboldCpp 参数配置(v1.118.1 实测)

参数表

参数设置说明
BackendUse CUDA已自动识别 RTX 5060 Laptop GPU
GPU ID0单卡保持 0
Use MMQ☑ 保持
GPU Layers-1自动分配,无需手动填 99
Use MMAP☐ 不勾第一轮求稳
FlashAttention☑ 保持长上下文有价值
Context Size8192从默认 12288 下调,给显存留余量(KV Cache 也吃显存)
ContextShift☑ 保持长对话有用
Launch Browser☑ 保持启动后自动打开 Web UI
Remote Tunnel☐ 关闭不需要暴露公网
Force AutoFit / Use Jinja☐ 关闭第一轮全部保持关闭
Port5001
Host0.0.0.0⚠️ 必须!只监听 127.0.0.1 时 Ubuntu 访问不到

启动步骤(按顺序,一层验证完再进下一层)

  1. 选择 GGUF 模型文件(D:\AI\Models\Qwen3-8B-Q4_K_M.gguf
  2. 按上表配置参数
  3. Launch / Start,观察控制台输出(应有 CUDA / RTX 5060 / offloading layers)
  4. 另开 PowerShell 运行nvidia-smi -l 1(每秒刷新):
    • 显存应从 ~1531 MiB 涨到 5000~7000+ MiB(/ 8151 MiB)
    • 生成文字时 GPU-Util 明显上升 → 证明GPU 真在推理,而不是 CPU 在跑
  5. Windows 浏览器打开http://127.0.0.1:5001,先本地测试模型能否正常对话
  6. Ubuntu 里wget -O- http://192.168.107.1:5001,验证跨网络可达
  7. 不要一次性做十件事,每层确认通过再继续

八、停止 / 卸载模型(释放显存)

8.1 KoboldCpp(本次实际使用方式)

  • 直接关闭启动终端窗口(点 ×),或终端内按Ctrl + C
  • 关闭后:KoboldCpp 后端停止 → 模型从显存卸载 → 显存释放(浏览器页面失效属正常)

8.2 关掉终端后显存仍未释放

nvidia-smi# 查看占用进程taskkill/IM koboldcpp.exe/F# 按实际进程名执行,不要照抄

8.3 如果用的是 Ollama(备选)

ollamaps# 查看当前加载的模型ollama stop qwen3:8b# 只卸载模型、释放 GPU 显存,服务保留(推荐)taskkill/IM ollama.exe/F# 需要整个服务关闭时# 终端对话中直接 Ctrl + C 终止当前推理

九、性能记录与后续调优

实测数据

  • 推理速度:42.28 t/s(Generated: 26/350 in 0.61s)——消费级 GPU 表现不错
  • 当时参数:n_ctx 8192n_predict 350temperature 1top_p 0.95

结论

感觉"模型效果不尽如人意",主要不是电脑慢,而是 8B 模型本身的能力上限 + 参数/上下文设置问题

下一步调优方向

  1. 先把 KoboldCpp + Qwen3-8B 的正确参数搞明白:思考模式(thinking)、上下文长度、GPU offload
  2. 上下文长度渐进测试:8192 → 12288 → 16384
  3. 链路稳定后,如需更强对话能力,换 12B/14B 更大模型(Q4/Q5 量化)
http://www.cnnetsun.cn/news/4050597.html

相关文章:

  • 2026论文神级降AIGC工具大曝光:智能算法直击安全阈值
  • 轻量级Kubernetes部署实战:k3s与Docker的融合方案
  • Cursor 改仓库权限第 2 天,Agent 把测试分支当成了生产——我的三层校验救场实录
  • 程序员为什么越来越离不开 AI?从代码调试到项目开发,真正拉开差距的是使用方式
  • OpenClaw开源机器人手:技术热度与市场认知的差距分析
  • PowerShell Core编码问题解决方案:从乱码到跨平台文本处理
  • 从OpenAI技术栈到实战:构建高可用AI服务后端架构详解
  • 基于SpringBoot的石材销售管理系统(源码+lw+部署文档+讲解等)
  • Windows打印后台处理程序服务崩溃深度诊断与修复指南
  • 网络安全实战:信息收集与优质靶场识别指南
  • SolidWorks钣金通风口命令实战:参数化风扇罩设计与工程图输出
  • LabVIEW工具包与模块安装全攻略:从原理到实战避坑指南
  • 深度解析Windows文件关联机制:解决AutoCAD DWG文件无法打开的注册表修复指南
  • AI漫剧制作教程:知漫剧全流程实践与角色一致性实现
  • AI重塑教育:从知识图谱到智能体,解析技术落地与角色变革
  • Kali Linux一周入门:零基础掌握渗透测试核心工具与实战
  • 2026濮阳危房鉴定检测怎么选?老旧房危房鉴定靠谱机构 TOP 结构安全检测+ 报告可查 电话汇总
  • 零成本搭建AI编程助手:VS Code集成DeepSeek API全攻略
  • 阿里云盘与夸克云盘Token/Cookie获取全攻略:原理、实战与排错
  • Postman Mock Server实战:零代码构建API模拟服务,驱动前后端并行开发
  • 从CAM到基础模型:视觉可解释性方法演进与实战指南
  • AI Agent核心架构解析:从LLM到工具调用的智能系统构建
  • 小龙虾烹饪全攻略:从挑选处理到经典口味制作
  • Redis Stack 部署与核心功能实战指南:从Docker安装到生产环境优化
  • 知识付费系统开发如何助力企业打造在线培训平台?
  • SSL证书部署全指南:从原理到实践,构建网站安全基石
  • Minimax Music开源,配套神器已开源,继AI视频自由后,AI音乐也自由了!
  • 从PID到模型预测:管道小球摆杆控制的核心难点与工程实现
  • RAG 召回率 95% 仍答错:Anthropic 重排机制差点让我交差一份科幻小说
  • Python包发布全流程指南:从项目打包到PyPI上架