AI 全栈专业名词科普:从入门到理解
AI 全栈专业名词科普:从入门到理解(通俗易懂全链路详解)
很多刚入门 AI 应用开发、大模型落地的同学,都会被大量专业名词劝退:Ollama、量化、私有化部署、LoRA、RAG、PagedAttention、微调、提示工程……
这些概念零散、术语抽象,网上资料参差不齐。本文把AI 全栈开发从部署、微调、提示工程、多模态、RAG 到后端交付的全套核心名词一次性梳理清楚,每个概念都讲明白:是什么、解决什么问题、为什么需要、怎么做、适用场景,全程通俗、无废话、可直接当学习手册和面试手册。
一、大模型推理部署(让模型跑起来)
1.1 Ollama — 本地大模型运行器
是什么:一款开源工具,让普通开发者仅需一条命令,即可在个人电脑、本地服务器运行大模型。
ollama run qwen3:4b解决什么问题:在 Ollama 出现之前,本地运行大模型门槛极高,需要手动安装 Python 环境、配置 CUDA 显卡驱动、下载海量权重文件、手写推理代码,普通开发者几乎无法落地。Ollama 将所有环境、依赖、适配逻辑全部封装,一条命令即可完成部署运行。
核心好处:
极简部署,单命令启动模型
兼容 OpenAI API 格式,换服务地址即可适配,无需改动业务代码
跨平台支持,CPU 设备也能运行测试
自动完成模型格式转换,无需手动处理权重文件
局限:并发处理能力较弱,仅适合个人学习、小型项目、测试场景,不适合企业大规模生产环境。
1.2 私有化部署 — 数据不出本机
是什么:将大模型部署在自己的服务器、本地设备中独立运行,不再调用第三方云端 API,所有计算流程、数据流转都在自有环境完成。
通俗对比:
方式 | 数据流向 | 通俗类比 |
|---|---|---|
调用公有云 API(如 OpenAI) | 你的数据 → 传到第三方服务器 → 返回结果 | 租用公共算力资源,便捷但数据外发 |
私有化部署 | 数据不出自有服务器,本地完成计算 | 自建专属算力资源,完全自主可控 |
判断项目为私有化部署的特征:
模型请求地址为 127.0.0.1(本机地址)
模型权重文件存储在本地服务器目录
无云端服务降级、备用配置
支持离线运行、禁止外网联网
适用场景:处理身份证、医疗、金融等敏感数据;接口调用量极大,长期调用云端成本过高;需要完全离线独立运行的项目。
1.3 OpenAI API 兼容 — 统一接口标准
是什么:OpenAI 定义了一套标准化的 HTTP 接口请求格式,目前已成为大模型调用的行业通用标准,Ollama、各类本地推理引擎均全面兼容该规范。
标准请求示例:
POST http://127.0.0.1:11434/v1/chat/completions { "model": "qwen3:4b", "messages": [{"role": "user", "content": "你好"}] }核心好处:切换模型、更换推理服务时,仅需修改接口地址、模型名称等配置,无需改动业务代码。类比 USB-C 通用接口,适配各类设备,通用性极强。
1.4 GGUF 量化 — 模型压缩格式
权重是什么:大模型训练完成后,本质是数十亿个浮点数组成的参数集合,存储在专属文件中,这些参数就是「模型权重」,决定模型的知识和能力。
量化是什么:降低权重数值的精度,在小幅牺牲极少量模型效果的前提下,大幅缩小模型体积、提升推理速度、降低设备资源占用。
量化效果对比:
原始 FP16:每个参数 2 字节,40 亿参数模型 ≈ 8GB
量化 Q4:每个参数 0.5 字节,40 亿参数模型 ≈ 2GB
类比:将 4K 高清视频压缩为 720P 清晰度,轻微损耗画质,但体积大幅缩小,普通设备可流畅播放。
GGUF 是什么:专为本地推理设计的量化模型格式,单个 .gguf 文件即可完整包含模型所有权重和配置信息,开箱即用。
Ollama 的价值:自动完成模型格式转换、量化适配,开发者无需手动处理权重文件,通过 ollama pull 命令即可直接下载可用的量化模型。
1.5 推理加速引擎:vLLM / Ollama / TGI
三者均为大模型推理运行引擎,核心定位、适配场景差异明确,可按需选型:
工具 | 特点 | 适合人群/场景 |
|---|---|---|
Ollama | 极简易用,单命令快速启动,零复杂配置 | 个人开发者、小团队、测试场景、轻量低流量业务 |
vLLM | 高性能、显存利用率高、支持高并发请求 | 企业生产环境、多用户同时访问、高流量业务 |
TGI | Hugging Face 官方出品,深度适配 HF 全生态 | 长期使用 Hugging Face 模型、数据集的开发团队 |
通俗类比:
Ollama = 家用小型料理机,满足单人、少量使用需求
vLLM = 商用专业设备,可同时承载大批量任务
TGI = 一体化智能设备,深度适配整套生态系统
1.6 并发 — 同时请求处理量
是什么:同一时刻,系统能够并行处理的 AI 请求数量。
低并发:2 人同时提问,Ollama 可轻松承载
高并发:500 名用户同时发起请求,必须使用 vLLM 等高并发引擎
引擎选型的核心依据:业务的同时在线请求量。
1.7 PagedAttention — vLLM 核心优化机制
解决的问题:传统大模型推理时,系统会为每个请求提前预留固定显存空间,即便实际使用量极少,剩余显存也无法复用,造成严重资源浪费。
实现思路:借鉴操作系统内存分页机制,将整块显存切分为多个微小内存页,实现按需分配、用完立即回收。
效果对比:
传统方式:单请求预留 3GB 显存,实际仅用 0.5GB,浪费 2.5GB
PagedAttention:用多少分配多少,无冗余浪费
通俗类比:传统模式是提前为每个人固定分配专属工位,空位闲置浪费;PagedAttention 是共享工位,来人分配、走人回收,空间利用率最大化。
最终效果:同等 GPU 硬件条件下,可承载数倍的并发请求量,大幅提升服务吞吐量。
1.8 Hugging Face 生态 — 大模型领域的开源社区平台
是什么:全球最大的大模型开源平台,不仅是模型下载站,更是完整的 AI 开发生态体系。
生态核心组成:
模型仓库:存储各类开源大模型权重文件
数据集仓库:开源训练、测试数据集
在线推理 API:可直接在线调用模型试用
Transformers:主流模型加载、运行 Python 库
TGI:官方大模型推理引擎
Spaces:免费 AI 演示应用托管服务
TGI 与 HF 的关系:TGI 是 Hugging Face 官方配套推理引擎,可自动从 HF 仓库拉取模型、适配格式、一键启动推理服务。
二、模型微调(让通用模型适配专属业务)
2.1 微调 — 通用模型进阶为领域专家
是什么:基于成熟的通用大模型,使用自有行业、业务专属数据进行二次训练,让模型学习垂直领域知识和业务规则。
效果对比:
通用模型:面对专业业务问题,回答宽泛、无针对性、不符合业务流程
微调后模型:回答精准、贴合行业规范、匹配业务流程
通俗类比:通用模型是掌握通识知识的应届生,微调是让应届生进入行业实习,专项学习岗位专业知识,成为领域能手。
2.2 指令微调 — 规范化输出训练
是什么:区别于知识微调,指令微调的核心不是让模型学新知识,而是规范模型的输出格式、应答逻辑。
效果对比:
微调前:同类问题输出格式混乱、自由发挥、无法对接程序
微调后:固定结构化输出,格式统一、可直接被后端程序解析使用
2.3 LoRA / QLoRA — 低成本微调方案
为什么需要:传统全量微调需要更新模型数十亿全部参数,硬件门槛极高,需要 50GB+ 显存的专业显卡(如 A100),普通设备无法实现。
LoRA 原理:冻结原始大模型所有参数,仅新增少量辅助参数矩阵(模型补丁),仅训练新增补丁,不改动原模型。
硬件门槛对比:
全量微调:50GB+ 显存,依赖高端专业算力卡,成本极高
LoRA 微调:12-16GB 显存,普通消费级显卡 RTX 4090 即可运行
QLoRA 微调:6-8GB 显存,低配显卡 RTX 4060 即可完成
通俗类比:
全量微调:整体翻新重构整套系统,成本高、改动大
LoRA:局部优化迭代,仅更新核心功能模块
QLoRA:在 LoRA 基础上叠加模型量化压缩,进一步降低硬件门槛
2.4 SWIFT — 一键微调工具
是什么:阿里开源的大模型微调框架,将复杂的 LoRA/QLoRA 微调流程封装为极简命令行操作,大幅降低微调开发门槛。
完整微调命令示例:
swift sft \ --model Qwen/Qwen3-4B \ # 基础预训练模型 --dataset my_data.jsonl \ # 训练数据集文件 --train_type lora \ # 微调方式(LoRA) --output_dir output/my-model # 微调模型保存路径参数释义:
swift:微调工具名称
sft:监督微调任务类型
--model:指定用于微调的基础大模型
--dataset:指定业务问答对训练数据集
--train_type:指定微调算法(LoRA/QLoRA)
--output_dir:微调完成后模型权重保存目录
2.5 微调实际流程与核心认知
标准微调落地流程:
准备业务数据集(占整体工作量90%)→ 执行微调训练命令 → 测试模型效果 → 迭代优化数据/参数 → 多轮重复调试 → 效果达标后部署上线
关键认知:微调的核心门槛不在于代码和操作,而在于高质量、标准化的业务数据集,数据质量直接决定微调最终效果。
三、提示工程与推理优化(低成本提升模型效果)
3.1 Prompt Engineering(提示工程)
是什么:通过优化提问话术、场景设定、格式约束、示例引导,规范大模型输出效果,无需微调模型即可低成本提升回答质量。
好坏提示对比:
劣质提示:「帮我分析一下数据」→ 模型自由发挥,输出混乱、无标准
优质提示:「你是专业数据分析助手,请按照数据概览、关键指标、异常点位、优化建议的固定格式分析数据」→ 输出结构化、标准化、可直接使用
核心实用技巧:
技巧 | 实现方式 | 最终效果 |
|---|---|---|
角色设定 | 为模型设定专业身份,如资深分析师、行业顾问 | 回答更专业、贴合场景、语气统一 |
Few-shot 示例 | 提问时附带多组标准问答示例 | 模型严格参照示例格式输出,一致性极强 |
CoT 思维链 | 要求模型分步推理、输出思考过程 | 复杂逻辑问题准确率大幅提升 |
3.2 CoT(Chain of Thought 思维链)
是什么:引导模型不直接输出最终答案,而是分步拆解问题、逐层推理、完整展示思考过程后,再给出结论。
效果对比:
无 CoT:提问「方案是否可行」→ 直接回答「可行」,无依据、易出错
有 CoT:提问「方案是否可行,请一步步推理」→ 分步分析需求匹配度、技术风险、资源储备,最终给出结论和注意事项
为什么有效:强制模型梳理完整逻辑链,避免跳步、主观臆断,如同人类做题书写草稿,大幅降低失误率。
3.3 Prompt 鲁棒性
是什么:模型对用户多样化提问方式的兼容能力,用户话术、句式、精简程度变化时,模型依然能稳定识别需求、输出正确结果。
效果对比:
鲁棒性差:标准提问可正确回答,精简口语化提问直接跑偏、答非所问
鲁棒性好:无论句式繁简、话术差异,均可稳定输出标准答案
优化方案:精细化 Prompt 设计、增加多样示例、覆盖边界场景测试、添加容错适配逻辑。
四、多模态与视觉能力(突破纯文本限制)
4.1 多模态
模态定义:文本、图片、音频、视频等各类信息载体,均为独立模态。
多模态是什么:模型可同时接收、解析、处理多种模态信息,突破纯文本输入输出的限制。
能力对比:
纯文本模型:仅支持文字输入、文字输出,无法识别图片、视频
多模态模型:支持文字+图片联合输入,可解析视觉内容并文字输出结果
多模态请求示例(图文输入):
{ "messages": [{ "role": "user", "content": [ {"type": "text", "text": "这张图里有什么"}, {"type": "image_url", "image_url": {"url": "图片地址"}} ] }] }重要说明:并非所有模型都支持多模态。Qwen3-4B 为纯文本模型,无法识别图片;Qwen-VL、GLM-4V 等专属多模态模型具备视觉解析能力。
4.2 OCR — 图片文字识别
是什么:光学字符识别技术,让设备自动识别、提取图片、截图、证件影像中的文字内容,转化为可编辑文本。
常见场景:证件信息自动录入、纸质文档电子化、截图文字提取、表单自动填充。
常用工具:百度开源 PaddleOCR(中文识别效果最优)、多模态大模型可视化文字识别。
4.3 计算机视觉(OpenCV / YOLO)
OpenCV:通用开源图像处理库,支持图片裁剪、画质增强、降噪处理、人脸检测等基础视觉操作
YOLO:实时目标检测算法,可快速框选图片、视频中的指定物体,适配目标识别、检测分类等实时场景
4.4 Dify — 可视化 AI 应用搭建平台
是什么:零代码可视化 AI 应用搭建平台,无需编程,通过拖拽操作即可快速搭建完整 AI 业务应用。
核心概念:
Workflow(工作流):预设固定业务流程,按步骤自动执行任务
Agent(智能体):模型自主判断业务逻辑,自主决策下一步操作
工具挂载:为智能体绑定数据库查询、第三方 API 调用等外部能力
五、RAG 检索增强生成(解决模型幻觉)
5.1 RAG 是什么
核心作用:让大模型不再依靠固有训练记忆回答问题,而是先检索专属知识库的真实资料,再基于检索内容生成答案,彻底解决模型幻觉、知识滞后、信息错误问题。
对比逻辑:
无 RAG:用户提问 → 模型凭记忆回答 → 易瞎编、信息老旧、不准确
有 RAG:用户提问 → 检索私有知识库 → 关联资料传入模型 → 基于真实资料作答 → 精准可信
通俗类比:RAG 是开卷考试(查资料答题),微调是闭卷考试(提前背知识点)。
5.2 RAG 优化链路
基础 RAG 链路:提问 → 检索 → 传入模型 → 生成回答
优化后高阶 RAG 链路:提问优化改写 → 多路检索扩召回 → 内容重排序 → 精准筛选 → 传入模型生成答案
优化价值:让提问更精准、检索内容更全面、有效信息优先级更高,最终回答质量大幅提升。
六、后端开发基础(AI 能力工程化落地)
6.1 Python/Flask 异步后端
后端:部署在服务器的后台程序,负责处理用户请求、操作数据库、调用大模型能力、返回业务结果。
Flask:轻量化 Python Web 开发框架,少量代码即可快速搭建 HTTP 服务,适配 AI 服务快速落地场景。
异步:支持多请求并行处理,互不阻塞,提升服务并发承载能力。
6.2 RESTful API 设计规范
行业统一的接口设计标准,通过请求方法区分业务操作,语义清晰、统一规范:
GET /api/items:查询数据列表
POST /api/items:新增数据
DELETE /api/items/123:删除指定数据
GET /api/items/123:查询单条详情
核心好处:接口语义直观,协作、维护成本极低。
6.3 工具挂载 — 给 AI 拓展实操能力
大模型原生仅具备对话生成能力,无法操作外部数据、对接第三方系统。工具挂载即为 AI 绑定外部工具能力,让模型可以自主查询数据库、调用外部 API、处理业务数据。
效果对比:
无工具挂载:用户询问业务数据,模型无法查询,仅能文字回复提示
有工具挂载:用户提问后,模型自主调用查询工具,获取真实数据后整理输出答案
6.4 Postman — 接口调试工具
是什么:无需开发前端页面,可直接手动构造、发送 API 请求,快速验证接口可用性、排查报错、测试边界场景的调试工具。
使用流程:选择 POST 请求方式 → 填入接口地址和参数 → 发送请求 → 查看返回结果与报错信息。
核心用途:开发阶段快速验证接口功能、定位 Bug、完成接口测试。
6.5 Swagger — 自动接口文档工具
可根据后端代码自动生成标准化网页版接口文档,代码迭代更新后,文档自动同步更新,无需手动编写、维护文档,保证接口说明与实际功能完全一致。
6.6 API 交付
将 AI 模型能力、后端业务逻辑统一封装为标准化 API 接口,实现一次开发、多端复用,可适配网页、小程序、客户端、第三方系统等各类终端调用。
6.7 Docker — 环境打包工具
解决问题:彻底解决「本地可正常运行、服务器运行报错」的环境不一致问题。
实现逻辑:将程序代码、运行环境、依赖库、配置文件整体打包为镜像,在任意设备、服务器均可一致运行,环境零差异。
通俗类比:无 Docker 如同现场手工搭建运行环境,极易出错;有 Docker 如同打包好的完整运行包,开箱即用、随处可跑。
七、AI 全链路能力总结
完整的 AI 全栈开发能力,是覆盖从模型选型、微调部署、逻辑编排、性能优化到 API 交付的闭环能力:
环节 | 核心含义 |
|---|---|
模型选择 | 根据业务场景、硬件条件、并发需求选型适配模型 |
微调部署 | 基于业务数据优化模型,完成本地化/私有化上线部署 |
逻辑编排 | 串联检索、工具调用、推理等步骤,形成完整业务流程 |
API 交付 | 封装能力为通用接口,供各业务系统调用 |
响应延迟优化 | 通过引擎、显存、链路优化,提升模型响应速度 |
Prompt 鲁棒性 | 保障模型在各类用户提问方式下输出稳定可靠 |
八、名词一句话速查表(快速复习)
名词 | 一句话通俗解释 |
|---|---|
Ollama | 一条命令即可在本地快速运行大模型的轻量化工具 |
私有化部署 | 数据不出本地环境,自主部署运行大模型,保障数据安全 |
OpenAI API 兼容 | 行业统一接口标准,切换模型无需修改业务代码 |
GGUF 量化 | 压缩模型体积、降低资源占用,让低配设备也能跑大模型 |
vLLM | 高并发、高性能大模型推理引擎,依托 PagedAttention 优化显存 |
TGI | Hugging Face 官方配套推理引擎,深度适配 HF 生态 |
Hugging Face | 大模型领域的开源社区与全套工具生态平台 |
微调 | 用专属业务数据训练通用模型,使其适配垂直行业场景 |
LoRA | 冻结原模型,仅训练少量补丁,实现低成本轻量化微调 |
QLoRA | 结合量化与 LoRA,进一步降低微调显存门槛 |
SWIFT | 阿里开源一键微调工具,简化 LoRA/QLoRA 操作流程 |
Prompt Engineering | 优化提问方式与格式,低成本提升大模型回答质量 |
CoT | 引导模型分步推理,避免跳步出错,提升复杂问题准确率 |
Prompt 鲁棒性 | 保障用户问法多变时,模型回答依然稳定准确 |
多模态 | 模型可同时处理文本、图片、音频等多种信息类型 |
OCR | 自动识别提取图片中的文字内容,转化为可编辑文本 |
OpenCV | 基础图像处理开源工具库,支持各类图片操作 |
YOLO | 实时高效的图片、视频目标检测算法 |
Dify | 零代码拖拽式 AI 应用可视化搭建平台 |
RAG | 检索增强生成,让模型查知识库再回答,解决幻觉问题 |
RESTful API | 后端统一、规范、易读的接口设计风格 |
工具挂载 | 为大模型绑定数据库、API 等能力,突破纯对话限制 |
Postman | 快速调试、测试 API 接口的开发工具 |
Swagger | 自动生成并同步更新后端接口文档 |
Docker | 打包程序与运行环境,实现跨设备一致运行,解决环境报错 |
