当前位置: 首页 > news >正文

oMLX 快速上手教程:5 分钟在 Mac 上跑起第一个本地大模型

oMLX 快速上手教程:5 分钟在 Mac 上跑起第一个本地大模型

【免费下载链接】omlxLLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar项目地址: https://gitcode.com/GitHub_Trending/om/omlx

oMLX 是一款免费开源的 LLM 推理服务器,专为 Apple Silicon(M 系列芯片)优化:它支持连续批处理、SSD 冷热分层 KV 缓存,还可以直接在 macOS 菜单栏管理。跟着这篇本地大模型部署教程,5 分钟就能让大模型在 Mac 上离线跑起来。

环境要求与安装 oMLX 的两种方式

运行 oMLX 本地大模型服务只需满足三个条件:

  • Apple Silicon 芯片(M1 / M2 / M3 / M4 / M5)
  • macOS 15.0(Sequoia)及以上
  • Python 3.11 – 3.13(安装官方 macOS 应用时无需手动配置)

方式一:下载 macOS 菜单栏应用(推荐新手)

从 Releases 页面下载.dmg,拖入「应用程序」文件夹即完成安装。应用自带一键自动更新,并会安装轻量 CLI 垫片~/.omlx/bin/omlx,方便终端控制服务。首次启动会弹出欢迎向导,按三步走即可:

oMLX 快速上手教程:欢迎向导三步配置模型目录、端口并启动本地大模型服务器

  1. Step 1 初始配置:确认 Base Directory、Model Directory(默认~/.omlx/models)与端口(默认 8000)
  2. Step 2 Start Server:点击按钮启动本地推理服务
  3. Step 3 Open Settings:打开管理面板,准备下载模型

方式二:Homebrew 一键安装

如果你习惯命令行,两条命令装好 oMLX 推理服务器:

brew tap jundot/omlx https://gitcode.com/GitHub_Trending/om/omlx brew install jundot/omlx/omlx

随后用生命周期命令管理后台服务(崩溃自动重启):

omlx start # 启动后台服务 omlx stop # 停止 omlx restart # 重启

日志分别在~/.omlx/logs/server.log(结构化应用日志)和$(brew --prefix)/var/log/omlx.log(服务日志)。

💡 临时体验?也可以用前台模式直接跑:omlx serve --model-dir ~/models,服务会默认监听 8000 端口,模型目录自动发现。

用内置下载器获取你的第一个模型

打开浏览器访问管理面板http://localhost:8000/admin,切换到Downloader选项卡,即可在面板内直接搜索并下载 Hugging Face 上的 MLX 格式模型:

选择建议:

  • M1 / M2:优先选 4bit 量化、参数 7B 左右的模型
  • M3 / M4 / M5 及以上:可挑战 30B 级别的中型模型
  • 注意磁盘空间:面板会显示每个模型的文件大小

下载完成后模型自动落入模型目录,服务器会按类型自动识别(LLM / VLM / OCR / Embedding / Reranker),无需任何手动配置。

打开内置 Chat 界面,与大模型对话

进入面板的Chat选项卡,选择已加载的模型,即可直接对话:

内置 Chat 支持会话历史、模型切换、暗色模式、推理模型输出展示,视觉模型(VLM)还能直接上传图片提问。到这里,你的第一个本地大模型就跑起来了 🎉

想测速?面板里的一键 Benchmark 会分别测出PP(Prefill)TG(Token Generation)每秒 token 数,并包含前缀缓存命中的真实场景数据。

管理面板与 API:像用 OpenAI 一样用 oMLX

Status 主面板实时展示服务状态与统计数据:

面板顶部还直接给出可用的 API 端点:

  • OpenAI 兼容 API:http://localhost:8000/v1
  • Anthropic 兼容 API:http://localhost:8000

任何 OpenAI 兼容客户端都能直接接入,例如:

curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model": "your-model", "messages": [{"role": "user", "content": "你好"}], "stream": true}'

菜单栏 App 让管理更轻量:不打开终端即可启停服务、查看持久化服务统计,崩溃自动拉起。

进阶能力速览

能力一句话说明
🔥 冷热分层 KV 缓存热数据驻留内存,冷数据落 SSD;即使服务器重启,历史上下文依然可复用,无需重新计算
⚡ 连续批处理多请求并发混批推理,默认最大并发 8,可用--max-concurrent-requests调整
🧊 多模型管理LRU 自动淘汰、手动加载/卸载、模型固定(Pinning)、按模型 TTL 空闲卸载
🔌 工具调用与结构化输出支持 Qwen、Llama、DeepSeek、GLM 等主流模型家族,兼容 MCP
🧩 生态集成面板内一键配置 OpenClaw、OpenCode、Codex、Hermes、Copilot、Pi
🖥️ 多 Mac 集群实验性:把一个大模型拆分到不同内存的多台 Mac 上联合推理

常见问题(FAQ)

  • 内存不够 / 想限制内存上限?启动时加--memory-guard safe--memory-guard-gb 48设置内存护栏,默认上限为「系统内存 − 8GB」,避免整机 OOM。
  • 端口被占用?在欢迎向导或管理面板中修改端口,或用omlx serve --model-dir ~/models配合环境变量OMLX_PORT
  • 想启用 SSD 缓存?omlx serve --model-dir ~/models --paged-ssd-cache-dir ~/.omlx/cache,KV 块将以 safetensors 格式落盘,前缀命中时从磁盘恢复而非重算。
  • 国产镜像加速?可加--hf-endpoint https://hf-mirror.com指定 Hugging Face 镜像端点。

项目关键路径速查

模块路径
项目说明README.md
中文文档README.zh.md
macOS 菜单栏应用源码apps/omlx-mac/Sources/
服务端主入口omlx/server.py
命令行入口omlx/cli.py
管理面板前端模板omlx/admin/templates/
OpenAI API 适配层omlx/api/adapters/openai.py
Homebrew 安装配方Formula/omlx.rb

🎯小结:oMLX 让「在 Mac 上跑本地大模型」这件事变得像装一个 App 一样简单——菜单栏管理、SSD 缓存、多模型并发、OpenAI 兼容 API 全部开箱即用。装好、下载模型、打开 Chat,5 分钟即可拥有完全离线、数据不出本机的大模型推理服务。祝你使用愉快!

【免费下载链接】omlxLLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar项目地址: https://gitcode.com/GitHub_Trending/om/omlx

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4289689.html

相关文章:

  • 【c语言】1.3 嵌入式中的位运算
  • 零基础写论文✅靠这一个工具,我全程零求助通关!
  • 如何在电脑上投屏并控制安卓手机:scrcpy 投屏工具完整教程
  • 2023工业峰会电机控制讲座:从PWM到FOC的实战干货笔记
  • LocalSend局域网传输实测:2.5GB压缩包40秒传完,新手三步就能上手
  • Deep-Live-Cam 实时人脸换脸上手指南:3 步出第一个结果
  • 数据管线的运行防线
  • 别只收三个数字:前端 RUM 如何建立可解释的体验数据链
  • DeepSeek V4-Flash发布:1M上下文与284B参数的长文本应用实战
  • 从ROS 2到仿真环境:具身智能机器人开发入门指南
  • 向量检索灰度阶段的验证方法
  • Delphi 13.1 + DevExpress VCL 25.2.7 安装配置与实战避坑指南
  • IAR C-Trust与NXP MCU:固件签名与安全启动实战解析
  • OpenHands 小说生成教程:3 步搭出你的 AI 情节优化助手
  • 从调用到实现:C语言库函数底层原理与安全实践
  • MinerU 文档解析工具上手指南:PDF/Office 转 LLM 可用 Markdown
  • Zed 安装配置实战:从一行命令安装到多人协作
  • STM32F746上基于CubeMX和TouchGFX的GUI移植实战指南
  • AI Chatbox与Dashboard:别用聊天框替换仪表盘
  • 2026 新闻事件 AI 传导分析:一键生成因果树看懂地缘与市场连锁反应
  • 数学建模竞赛:用Matplotlib打造专业图表的高效实战指南
  • Crawl4AI 实战手册:从安装到并发爬取、动态页面与结构化提取的完整路径
  • Dify实战:从部署到API发布,搭建简历筛选Agent工作流
  • 电子商务服装产品分类数据集
  • Hermes Agent 文献检索与论文写作实战指南
  • AI编程与工程实践:从AI Agent到团队效能重构的完整指南
  • 3D打印积木全攻略:FDM公差控制与参数调优实战指南
  • PowerToys文本提取器:3步提取屏幕任意文字
  • 用Nucleo板载ST-LINK V3调试外部STM32芯片全攻略
  • PaddleOCR 设备铭牌识别实战指南:从三步上手到结构化提取与调优