【AI大模型接入SDK】名词解释
《Linux操作系统编程详解》《笔试/面试常见算法:从基础到进阶》《Python干货分享》
🎬 艾莉丝的简介:
文章目录
- 1 ~> AI 模型基础概念
- 1.1 模型(Model)核心定义
- 1.2 工作逻辑类比
- 1.3 领域边界说明
- 2 ~> 大模型(Large Model)
- 2.1 核心定义
- 2.2 “大” 的核心体现
- 2.2.1 参数量级庞大
- 2.2.2 训练数据规模极大
- 2.2.3 算力与能耗极高
- 2.3 能力特征
- 3 ~> 大语言模型(Large Language Model, LLM)
- 3.1 核心定义
- 3.2 本质原理
- 3.3 三大核心局限性
- 3.3.1 幻觉(Hallucination)
- 3.3.2 无真正理解
- 3.3.3 偏见与安全风险
- 3.4 能力边界
- 3.4.1 核心限制
- 3.4.2 非语言任务的 “翻译” 策略
- 3.4.3 核心盲区
- 3.5 主流代表模型
- 4 ~> 提示词(Prompt)工程
- 4.1 提示词定义
- 4.2 提示词设计三要素
- 4.2.1 角色设定(Role)
- 4.2.2 任务描述(Task)
- 4.2.3 格式约束(Format)
- 4.3 提示词工程师岗位
- 5 ~> 上下文(Content)机制
- 5.1 核心定义
- 5.2 上下文窗口限制
- 6 ~> Token 机制与计费
- 6.1 Token 核心定义
- 6.2 字符换算规则
- 6.3 计费模式(以 DeepSeek 为例)
- 6.4 扣费规则
- 7 ~> 拓展:LLM 边界突破 —— 具身智能
- 7.1 核心方向
- 7.2 三层突破路径
- 7.2.1 第一层:低级感知(技术成熟阶段)
- 7.2.2 第二层:高级交互(技术突破阶段)
- 7.2.3 第三层:根本性重塑(未来愿景)
- 7.3 三大现实技术障碍
- 7.3.1 数据瓶颈
- 7.3.2 计算延迟
- 7.3.3 灾难性遗忘
- 7.4 结论
- 结尾
1 ~> AI 模型基础概念
1.1 模型(Model)核心定义
AI 领域的模型本质是从海量数据中学习规律、用于执行预测任务的复杂数学函数,具备规模庞大的参数与高度复杂的内部计算机制,是人工智能能力的载体。
1.2 工作逻辑类比
可类比为牙牙学语的婴幼儿:
- 输入端:通过多模态渠道(听觉、视觉)接收海量环境数据,包括日常对话、物品认知、行为示范等。
- 学习过程:在持续输入中总结事物与语言的关联规则,建立自身的认知逻辑。
- 输出端:接收到指令后,基于总结的规律输出符合预期的响应。
1.3 领域边界说明
“模型” 为跨领域通用术语,本范畴内特指 AI 领域的机器学习 / 深度学习模型,区别于物理模型、数据模型、实体玩具模型等其他领域的 “模型” 概念。
2 ~> 大模型(Large Model)
2.1 核心定义
参数量与训练数据规模达到极高量级的综合型 AI 模型,具备跨领域、多任务的处理能力,可同时覆盖文本、语音、视觉等多种模态,是 AI 领域的全才型系统。
2.2 “大” 的核心体现
2.2.1 参数量级庞大
参数量达到百亿至千亿级别,远高于早期 AI 模型。典型代表:GPT-3 参数量为 1750 亿,而早期传统 AI 模型参数量不足百万。
2.2.2 训练数据规模极大
训练数据覆盖全网文本、专业书籍、学术论文、开源代码、音视频内容等全维度信息,数据量级达到 PB 级。
2.2.3 算力与能耗极高
训练过程需要大规模计算集群支撑,能耗极高。
注意:行业估算 GPT-3 单次训练耗电量约 190 万度,该数据为量级参考,非精确计量值。
2.3 能力特征
具备多模态处理能力,可同时实现视觉理解、语音识别、文本生成、逻辑推理等多种任务,区别于仅能处理单一任务的传统 AI 模型。
3 ~> 大语言模型(Large Language Model, LLM)
3.1 核心定义
以人类自然语言为核心处理对象的大模型,通过学习海量文本数据掌握词语间的统计关联规律,可实现对话、写作、翻译、代码生成等各类语言类任务。
3.2 本质原理
大语言模型的核心是基于概率的下一个词元预测: 通过 Transformer 神经网络学习海量文本中词汇的上下文关联,输入文本序列后,输出统计概率最高的接续内容。其本身不具备对语义的真正理解,所有输出均基于文本统计规律。
3.3 三大核心局限性
3.3.1 幻觉(Hallucination)
会生成语法通顺、看似合理,但完全不符合客观事实的虚假内容,即无依据的错误输出。
3.3.2 无真正理解
仅掌握词语在文本中的统计关联,不理解物理世界的客观规律,也不具备任何感官体验与主观意识。
3.3.3 偏见与安全风险
训练数据中存在的人类社会偏见会被模型继承与放大,同时存在生成违规、有害内容的安全风险。
3.4 能力边界
3.4.1 核心限制
仅能处理被人类语言符号化、编码过的信息:
- 无法直接感知物理世界的光、电、力等物理量,仅能处理描述这些现象的文本
- 无真实感官体验,仅掌握 “疼痛”“颜色” 等词汇的文本用法
- 无法处理无规律乱码、训练集未覆盖的加密语言
3.4.2 非语言任务的 “翻译” 策略
现实中模型处理代码、公式、图像的本质,是将其转化为模型可理解的语义符号,而非真正理解该领域:
- 代码处理:将编程语言视作特殊格式的技术文本,学习语法规则与文本关联
- 数学公式:将数学符号视作压缩的自然语言,基于海量论文文本学习推导逻辑
- 多模态处理:通过专用编码器将图像 / 音频转化为特征向量,作为隐含语义输入 LLM,模型处理的仍是语义空间,而非原始感官信号
3.4.3 核心盲区
无法生成未被文本记录的物理常识与直觉推理,只能复现语言中已记录的知识,无法像人类一样通过物理直觉推导全新现象。
3.5 主流代表模型
文档示例包括 GPT 系列、Gemini 系列、Claude 系列、DeepSeek 系列、Qwen(阿里千问)系列、豆包系列等。
注意:所列具体版本号多为前瞻性示例,需以官方正式发布为准。
4 ~> 提示词(Prompt)工程
4.1 提示词定义
用户向大模型传递任务需求的文本指令,是人与大模型交互的核心载体。提示词的表述精度、完整度直接决定模型输出结果的质量。
4.2 提示词设计三要素
4.2.1 角色设定(Role)
为模型指定明确的身份、专业背景与立场,约束输出的视角与专业深度。 示例:
你是一个具有十年以上C++后端开发经验的架构师,请帮我设计类似微信的聊天软件4.2.2 任务描述(Task)
清晰、具体地说明需要模型完成的核心任务,避免模糊表述。 示例:
用200字总结导致拖延症的核心原因4.2.3 格式约束(Format)
指定输出的结构、篇幅、呈现形式等规范,统一输出标准。 示例:
请按要点分条列出,每条不超过15字4.3 提示词工程师岗位
AI 开发领域的专门岗位,核心职责包括:
- 设计、优化、测试大模型提示词,提升生成内容的准确率与实用性
- 结合业务场景落地大模型能力,设计行业解决方案
- 维护与优化知识库,提升大模型回答的准确性
5 ~> 上下文(Content)机制
5.1 核心定义
大模型在单次对话会话中可以临时保留的历史交互信息,使模型能够结合前后文理解用户意图,实现连贯的多轮对话,类比人类的短期记忆。
5.2 上下文窗口限制
模型可保留的上下文长度存在明确上限,超出窗口长度的历史信息会被丢弃,类似计算机内存溢出后的覆盖机制。
- 典型示例:GPT-4 的上下文窗口可达 128k tokens,约对应 10 万字文本
注意:不同型号模型的上下文窗口差异极大,从 4k 到百万 token 级别不等,需以具体模型的官方参数为准
6 ~> Token 机制与计费
6.1 Token 核心定义
Token(词元)是大模型处理自然语言的基本单位,同时也是大模型 API 服务的通用计费单位。通常一个中文词语、英文单词、单个数字或符号对应 1 个 token。
6.2 字符换算规则
不同模型的分词器(Tokenizer)规则不同,换算比例存在显著差异。以 DeepSeek 官方给出的参考比例为例:
- 1 个英文字符 ≈ 0.3 个 token
- 1 个中文字符 ≈ 0.6 个 token
注意:该比例仅为 DeepSeek 分词器的参考值,不可通用到所有大语言模型,实际 token 数量以模型返回的
usage字段为准。
6.3 计费模式(以 DeepSeek 为例)
计费按输入、输出分别计算,输入侧区分缓存命中与未命中场景:
| 计费项 | 单价(每百万 tokens) |
|---|---|
| 输入(缓存命中) | 0.5 元 |
| 输入(缓存未命中) | 4 元 |
| 输出 | 12 元 |
6.4 扣费规则
- 扣费公式:扣减费用 = token 消耗量 × 对应项单价
- 余额优先级:同时存在充值余额与赠送余额时,优先扣除赠送余额
- 价格说明:产品价格可能随官方策略调整,以实时公示为准
7 ~> 拓展:LLM 边界突破 —— 具身智能
7.1 核心方向
通过为 AI 接入物理实体与传感器,打破纯文本模型的能力边界,实现对物理世界的真实感知与交互,该方向在学术界被称为具身智能与多模态感知融合。
7.2 三层突破路径
7.2.1 第一层:低级感知(技术成熟阶段)
通过传感器将物理信号转化为数字信号,输入模型处理:
- 视觉感知:摄像头采集画面,经视觉编码器转化为语义向量
- 听觉 / 触觉感知:麦克风、压力传感器采集模拟信号,数字化后提取波形 / 力觉特征
- 局限性:仍属于数字信号处理,模型不具备真实感官体验,仅丰富了输入数据的形式
7.2.2 第二层:高级交互(技术突破阶段)
通过实体行动形成闭环学习,建立因果关联:
- 触觉反馈闭环:通过实时传感器数据动态调整动作,形成无法用语言精确描述的 “肌肉记忆”
- 空间导航:通过激光雷达构建物理三维地图,通过自身移动验证与修正空间认知
- 核心价值:认知逻辑从 “词汇关联” 升级为 “动作→结果” 的因果关联,是纯文本模型永远无法生成的能力
7.2.3 第三层:根本性重塑(未来愿景)
形成独立于人类语言的内部认知表征:
- 直觉智能:核心决策基于连续物理时序数据,无需转化为人类语言
- 非语言知识:对物理世界的认知包含多维连续数据,信息密度远超自然语言的描述能力
7.3 三大现实技术障碍
7.3.1 数据瓶颈
高质量物理交互数据获取成本极高,数据规模远小于互联网纯文本数据,难以支撑大模型训练。
7.3.2 计算延迟
物理世界要求毫秒级实时响应,而大模型单 token 生成存在百毫秒级延迟。当前主流方案为大小脑分工:传统控制算法负责快速反应(小脑),大模型负责高层任务规划(大脑)。
7.3.3 灾难性遗忘
模型学习物理交互能力后,可能出现原有语言能力退化的问题,多能力和谐共存是顶级实验室正在攻克的难题。
7.4 结论
- 纯大语言模型本身永远无法打破语言边界,其设计目标就是处理文本信息。
- 未来通用人工智能是复合系统:LLM 负责语言理解、规划推理(类比大脑额叶),传感器与运动模块负责感知与行动(类比小脑、脑干)。
- 物理能力将绕过 LLM 的语言限制,建立平行于人类语言的物理认知体系,而非从内部打破 LLM 的语言边界。
结尾
uu们,本文的内容到这里就全部结束了,艾莉丝在这里再次感谢您的阅读!
|
结语:希望对学习Linux相关内容的uu有所帮助,不要忘记给博主“一键四连”哦!
🗡博主在这里放了一只小狗,大家看完了摸摸小狗放松一下吧!🗡 ૮₍ ˶ ˊ ᴥ ˋ˶₎ა
