当前位置: 首页 > news >正文

大模型分类体系

1、简述

大模型(基础模型 Foundation Model)分类采用多维度正交划分,不同维度可交叉组合定位模型;分为技术底层维度、数据模态维度、规模算力维度、训练范式维度、应用层级维度、部署形态维度、开源版权维度、任务能力维度八大体系,覆盖学术、工程、产业落地全场景。

2、按底层神经网络架构(技术底层,最核心学术分类)

全部基于 Transformer 衍生,分 4 大类,决定模型能力边界:

2.1 Encoder-only 仅编码器(双向理解型)

  • 原理:双向注意力,MLM 掩码预训练,同时读取上下文左右信息
  • 优势:文本理解、语义匹配、分类、抽取精度极高
  • 短板:不擅长长文本生成
  • 适用:检索、情感分析、NER、文本打分、知识库向量
  • 代表:BERT、RoBERTa、ERNIE-Base、SimBERT

2.2 Decoder-only 仅解码器(自回归生成,当前主流 LLM)

  • 原理:单向从左到右逐 Token 预测,CLM 因果语言建模
  • 优势:开放式长文本生成、对话、逻辑推理、代码写作
  • 适用:聊天机器人、文案、代码、报告、思维链推理
  • 代表:GPT 全系列、Llama3/4、Qwen2/3、GLM、Mistral、DeepSeek

2.3 Encoder-Decoder 编解码(序列转换专用)

  • 原理:编码器理解输入,解码器独立生成输出
  • 优势:翻译、摘要、改写、短序列转换
  • 短板:超长自由生成弱于纯 Decoder
  • 代表:T5、BART、ChatGLM 初代、mT5

2.4 MoE 混合专家稀疏架构(超大参数量旗舰架构)

  • 原理:总参巨大,但每次推理仅激活少量专家模块,算力可控
  • 分类:MoE-Decoder、MoE-Encoder-Decoder、MoE 多模态
  • 优势:万亿级参数、强通用能力、训练成本低于稠密大模型
  • 代表:GPT-4、Qwen3-Max、Gemini Ultra、Mixtral 8x7B

2.5 补充:非 Transformer 传统大模型(边缘小众)

CNN 视觉大模型(ViT 变体)、RNN 系模型(已淘汰)

3、按输入输出模态(产业最常用分类)

3.1 单模态大模型(仅一类数据)

  1. LLM 纯文本大语言模型输入输出均为文字;擅长逻辑、数学、文书、代码通用对话;代表:GPT-3.5、Llama3、通义千问基础版
  2. Code-LLM 代码专用大模型文本子集,海量代码语料专项训练;代码补全、漏洞检测、跨语言转换、工程注释;代表:CodeLlama、DeepSeek-Coder、StarCoder
  3. 视觉大模型 LVM仅图像输入输出:图像分类、分割、检测;代表:ViT、SAM、Stable Diffusion(纯视觉生成)
  4. 音频大模型 LAM语音识别、语音合成、音乐生成;代表:Whisper、AudioLDM
  5. 视频单模态模型短视频生成、动作识别;代表:Sora、可灵、Veo

3.2 多模态大模型 MLLM(Any-to-Any 跨模态融合)

统一语义空间,同时处理文本 / 图像 / 音频 / 视频 / 3D / 文档:

  1. 多模态理解型:图文问答、图表解析、视频摘要、OCR 文档分析;代表:GPT-4V、Qwen-VL、LLaVA
  2. 多模态生成型:文生图、文生视频、图文转音频、3D 生成;代表:GPT-4o、Gemini Omni、Sora、万相、Seedance
  3. 全模态 Omni 模型:实时语音对话 + 视觉 + 视频一体化,端到端音视频交互

4、按参数规模(算力 / 部署分级,工程落地核心)

以稠密模型标准划分,MoE 标注激活参数而非总参数:

分级参数量区间部署场景典型代表
超轻量端侧模型<1B手机、IoT、嵌入式、离线本地Qwen2-0.5B、Phi-3-mini、Gemma-2B
轻量模型1B~10B边缘服务器、个人 PC、低成本私有化ChatGLM3-6B、Mistral-7B、Baichuan2-7B
中型模型10B~70B企业私有化、API 轻量化服务Llama3-13B/70B、Qwen2-14B、DeepSeek-67B
大型稠密模型70B~400B云端旗舰、高推理需求场景Llama3-400B、Claude 3 Sonnet
超大规模 MoE 模型总参≥1T,激活 10B~200B公有云顶级通用模型GPT-4、Gemini Ultra、Qwen3-Max

5、按训练迭代阶段(模型成熟度分类)

完整训练流水线 4 级递进:

  1. 预训练底座模型(Base Model)仅通用海量数据预训练,无指令、无人类对齐;输出自由、无格式约束,不适合直接对话;多用于二次微调
  2. 指令微调模型(SFT Supervised Fine-tune)加入指令数据集,学会遵循用户指令、结构化输出;可直接做基础对话、工具调用
  3. 人类对齐模型(RLHF/DPO)人类反馈强化学习 / 直接偏好优化;安全、价值观对齐、降低幻觉、输出符合人类习惯;市面商用对话模型主流形态(ChatGPT、Claude、文心一言)
  4. 工具增强基座(Agent 大模型)内置工具调用、函数调用、检索增强能力,可联网、调用插件、操作数据库、控制机器人

6、按应用层级(L0/L1/L2 三层产业分层)

L0:通用基础大模型(通用底座)

无行业偏向,覆盖全领域通用知识,具备通用推理、创作、理解能力;是所有垂直模型的底层底座

  • 闭源:GPT-4o、Claude 3、Gemini、文心一言、通义千问
  • 开源:Llama3、Qwen3、GLM4、DeepSeek-V3

L1:行业大模型(单行业通用)

基于 L0 底座,注入全行业通用数据,覆盖行业全场景;不局限单一细分任务

  • 金融大模型、医疗大模型、法律大模型、工业制造大模型、教育大模型、自动驾驶大模型

L2:垂直场景专用模型(细分任务专用)

在行业模型基础上针对单一细分任务专项训练,精度最高、泛化最弱

  • 法律:合同审查模型、裁判文书生成模型
  • 医疗:CT 影像诊断、药品研发分子模型 AlphaFold2
  • 工业:质检视觉大模型、设备故障预测模型
  • 办公:PPT 生成、OCR 文档解析、代码审计专用模型

7、按部署运行形态(运维选型分类)

  • 云端 SaaS 模型:厂商 API 调用,无需本地算力,开箱即用(GPT、通义千问公有云)
  • 私有化本地部署模型:企业机房服务器部署,数据不出内网(开源 7B/13B/70B 系列)
  • 端侧离线模型:手机、平板、边缘硬件本地运行,无网络依赖(<10B 轻量模型)
  • 混合部署模型:轻量端侧做基础交互,云端大模型处理复杂推理

8、按开源 / 版权授权(生态分类)

  1. 闭源商用模型:权重不开放,仅开放 API,无法本地微调;OpenAI GPT、Anthropic Claude。
  2. 完全开源模型:权重、训练代码全开放,商用无限制;Qwen 全系列、DeepSeek。
  3. 受限开源模型:权重开放,商用有营收 / 规模限制;Llama3(Meta 商用许可)、Gemma。
  4. 学术开源模型:仅限科研,禁止商用;LLaVA、早期 BERT 变体。

9、按任务能力范式(功能分类)

1. 判别 / 理解型模型

输入数据做分类、打分、抽取、检索,不生成全新内容;BERT、向量检索模型、风险判别模型

2. 生成式模型(AIGC 核心)

输出全新文本 / 图像 / 音视频 / 代码;GPT、Sora、Stable Diffusion、CodeLlama

3. 推理数学专用模型

强化数理逻辑、符号计算、复杂数学证明;DeepSeek-Math、Qwen-Math、Numina

4. 检索增强 RAG 模型

底座 + 外挂知识库,解决实时信息、私有数据、幻觉问题;企业知识库问答系统专用

5. 机器人 / 具身智能大模型

文本视觉 + 机器人动作控制,物理世界交互;Google Robotics Transformer、特斯拉 FSD 大模型

6. 科学计算基础模型

面向科研:蛋白质结构、气象预测、流体仿真、量子计算;AlphaFold2、风乌气象大模型

10、极简分层总览

底层架构 → 模态输入 → 参数规模 → 训练阶段 → 应用层级 → 部署方式 → 开源属性 → 任务功能。

http://www.cnnetsun.cn/news/3580720.html

相关文章:

  • 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (7)--- Policy Serving
  • TI C6000 DSP SYSCFG模块配置详解:从CHIPSIG到CFGCHIP的嵌入式系统核心控制
  • UVa 11669 Non Decreasing Prime Sequence
  • ComfyUI与Hermes Agent:自然语言控制AI绘画工作流
  • 临沂鑫旺2026 耐腐材质告别后期频繁更换
  • FTP服务部署与优化:vsftpd实战指南
  • Seedance3.0本地部署实战:免费AI视频生成与绘画完整指南
  • Spark MLlib分布式机器学习框架入门与实践
  • 嵌入式外设驱动核心:I2C与LCD控制器寄存器配置与中断处理实战
  • 前端开发环境配置常见问题与解决方案
  • AI工具如何提升学术论文写作效率与质量
  • 2026年AI学术写作工具评测与应用指南
  • Informer:长序列时间预测的Transformer优化方案
  • Open CaptchaWorld:多模态验证码测试与评估平台
  • Unity UGUI性能优化实战:数字孪生项目中的Canvas渲染与控件优化策略
  • 跨境价格监控为什么会误判?关键在地区上下文校验
  • 免费AI绘画解决方案:Stable Diffusion本地部署与优化实践
  • 2026年AI写作论文工具排行榜:5款热门工具真实对比
  • 《墨香情》三端互通MMORPG安全下载与优化指南
  • SIEMENS 6SE6420-2AB17-5AA1 控制系统
  • AI如何加速药物临床试验的数据处理与审批
  • 【AI量化交易实战】第02讲:看懂K线与估值——A股市场语言一本通
  • 蚂蚁开源万亿参数模型Ring-2.5-1T:架构解析与应用实践
  • sin(x)在 x to infty时极限不存在。
  • 动画短片制作全流程解析:从技术实现到电影节投稿指南
  • GitHub仓库安全:6个免费设置提升开源项目防护能力
  • LLaMA 1技术架构解析与本地部署实践指南
  • C++实现2048游戏:从数据结构到图形界面的完整项目实践
  • iOS高效开发必备:精选开源工具库解析
  • 8款AI工具提升论文写作效率实测指南