当前位置: 首页 > news >正文

InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解

InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解

【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B

InternVL3.5-4B 是 OpenGVLab 开源的轻量级多模态大模型,总参数量约 4.7B,采用经典的「ViT-MLP-LLM」架构:InternViT-300M 视觉编码器 + MLP 投影层 + Qwen3-4B 语言模型。本文逐层拆解这套多模态范式的实现细节,讲清它如何把一张图片变成视觉 token 序列并交给 LLM,帮助新手彻底看懂轻量级 VLM 的架构原理。

💡 30 秒概览:三个「零件」拼成一个模型

组件模型参数量职责
视觉编码器InternViT-300M0.3B切图、提取视觉特征
投影层Pixel Shuffle + MLP约几 M压缩视觉 token、对齐维度
语言模型Qwen3-4B4.4B多模态理解、推理与生成

关键数字:每个 448×448 图像切片最终转换为256 个<IMG_CONTEXT>视觉 token;一张原图会被动态切成1~12 个切片 + 1 张缩略图(见config.json中的max_dynamic_patch=12downsample_ratio=0.5)。

📐 数据流全景:一张图如何变成回答

  1. 动态切图:按最接近的宽高比把原图切成 1~12 个 448×448 切片,再附一张缩略图;
  2. 视觉编码:每个切片进入 InternViT(24 层 Transformer),448÷14=32,得到 32×32=1024 个 patch 特征 + 1 个 CLS token;
  3. token 压缩:pixel shuffle 把 1024 个 token 压成 256 个(每个 token 维度变为 4 倍);
  4. 投影对齐mlp1把 4096 维映射到 Qwen3 的 2560 维;
  5. 占位替换:输入 embedding 序列中的<IMG_CONTEXT>占位符逐个换成视觉特征(见modeling_internvl_chat.pyforward);
  6. 自回归生成:Qwen3-4B 基于「文本 + 视觉」混合序列生成回答。

🔍 第一层:InternViT 视觉编码器

实现在modeling_intern_vit.py,关键参数来自config.jsonvision_config段:

参数含义
num_hidden_layers24Transformer 层数
hidden_size1024隐层维度
num_attention_heads16注意力头数
patch_size14切片窗口大小(像素)
image_size448每个切片分辨率
hidden_act / normgelu / layer_norm激活与归一化方式

几个值得留心的设计细节:

  • 可插值位置编码_get_pos_embed用双三次插值把 32×32 的位置编码表重采样,因此任意尺寸的切片都能拿到合适的位置信息;
  • LayerScale + DropPath:每层带ls1/ls2缩放参数和随机深度(drop_path_rate=0.1),让大视觉编码器训练更稳;
  • FlashAttention 加速:配置了use_flash_attn=true,自注意力走flash_attn_varlen_qkvpacked_func快速路径。

「动态高分辨率」由config.jsondynamic_image_size=truemin_dynamic_patch=1max_dynamic_patch=12use_thumbnail=true共同控制:小图只切 1 块,信息量大的图表、文档则最多切 12 块「看得更仔细」,兼顾精度与开销。

🧮 第二层:MLP 投影层——视觉与语言之间的「翻译官」

这是 ViT-MLP-LLM 中「MLP」的核心,位于modeling_internvl_chat.pyInternVLChatModel.__init__

  • pixel shuffledownsample_ratio=0.5):把 32×32 网格的 1024 维特征重排为 16×16 网格的 4096 维特征,token 数从 1024 压到 256,序列长度骤降 4 倍;
  • mlp1LayerNorm(4096) → Linear(4096→2560) → GELU → Linear(2560→2560),完成到 Qwen3 隐层维度的对齐。

算一笔账:一张 12 切片 + 缩略图的图像会注入 256×13 =3328 个 token——这就是多模态对话为什么特别「吃」上下文窗口的原因。

🤖 第三层:Qwen3-4B 语言模型

参数定义在config.jsonllm_config段(架构为Qwen3ForCausalLM):

参数参数
num_hidden_layers36hidden_size2560
num_attention_heads32num_key_value_heads8(GQA)
intermediate_size9728max_position_embeddings40960
rope_theta1,000,000vocab_size151,936
hidden_actsiluattention_biasfalse

两个亮点:分组查询注意力(32 个 Q 头共享 8 个 KV 头)显著降低推理时的 KV 缓存占用;40K 上下文足以容纳多张高分辨率图 + 长文档对话。

🏋️ 训练管线:四步走到最终版本

README.md说明,InternVL3.5-4B 依次经历:

  1. CPT(多模态持续预训练):文本 + 多模态语料联合训练,配合平方根加权的最下一个词预测损失;
  2. SFT(监督微调):32K 上下文,引入「思考模式」推理数据;
  3. MPO(离线强化学习):DPO + BCO + LM 三项损失组合——当前仓库模型的直接基座(README.mdbase_model指向InternVL3_5-4B-MPO);
  4. GSPO(在线强化学习):级联强化学习收尾,MMMU、MathVista 等推理基准大幅提升。

🚀 快速上手:最低门槛的部署方式

环境要求transformers>=4.52.1,单张 24G 显存 GPU 即可跑起来(官方说明 30B 及以下可单卡 A100 部署,4B 更轻松):

import torch from transformers import AutoModel, AutoTokenizer path = "OpenGVLab/InternVL3_5-4B" model = AutoModel.from_pretrained( path, torch_dtype=torch.bfloat16, low_cpu_mem_usage=True, use_flash_attn=True, trust_remote_code=True, device_map="auto").eval() tokenizer = AutoTokenizer.from_pretrained(path, trust_remote_code=True) question = '<image>\nPlease describe the image shortly.' # pixel_values 由动态切图得到(完整示例见 README.md 的 load_image) response = model.chat(tokenizer, pixel_values, question, dict(max_new_tokens=1024, do_sample=True))

要开启「思考模式」,只需把系统提示词换成官方 R1 提示并设置do_sample=Truetemperature=0.6。在线服务场景可直接用 vLLM 或 LMDeploy 起 OpenAI 兼容 API:lmdeploy serve api_server OpenGVLab/InternVL3_5-4B --server-port 23333 --tp 1

📁 关键文件速查

文件作用
config.json顶层配置 +vision_config+llm_config三段式结构
modeling_intern_vit.pyInternViT 视觉编码器(Embeddings / Attention / Encoder)
configuration_intern_vit.pyViT 配置类(本模型覆盖为 24 层)
modeling_internvl_chat.py主模型:pixel shuffle、mlp1、chat / generate 逻辑
configuration_internvl_chat.py组合式配置,把 vision 与 LLM 配置拼装在一起
conversation.py对话模板(本模型使用internvl2_5模板)
special_tokens_map.json<img><IMG_CONTEXT><box>等特殊 token
chat_template.jinja新版 transformers 的聊天模板

📌 写在最后

InternVL3.5-4B 用 4.7B 的体量证明:ViT-MLP-LLM 范式简单却高效——InternViT 负责「看」,pixel shuffle + MLP 负责「压缩」,Qwen3-4B 负责「想与说」。动态高分辨率切图让它能看清细节,级联强化学习训练让它具备数学与图表推理能力,是理解开源多模态大模型架构的绝佳入口。

【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4228606.html

相关文章:

  • 2026毕业避坑[特殊字符]别乱买论文工具!这一个免费全能款就够了
  • 微信4.0改名weixin.dll导致补丁失效?3步用RevokeMsgPatcher找回防撤回
  • 大型量产固件的工程实践(十一):健壮的网络状态机——链路监控与指数退避重连
  • django-csp 4.0破坏性变更迁移指南:一条manage.py check命令自动生成新配置
  • .well-known/graph-api 背后的玄机:fb-instant-articles 的 OAuth 令牌与 RSA 签名安全设计完全解析
  • AI 时代营销正在变天,很多企业还在沿用搜索时代的旧思路
  • 项目制GEO与在线订阅平台:从系统边界看两种实现方式
  • 别再盲目买国产手操器!弄懂这点,工业调试少走弯路
  • HoRain云--RSS 阅读器
  • 新能源车辆车型大全API:从品牌列表到车型配置
  • Java 基础|变量、数据类型、类型转换、表达式与运算符
  • [光学原理与应用-549]:用光量子的三重底层特征(粒子性、波动性、随机性)阐述线性光学特征和非线性光学特征,以及介质自身的特征如何影响光量子与介质的相互作用,以及展现出宏观特征。
  • 代码里实际能看到的路径 + 注释里的设计意图
  • Kimi苹果版导出表格的终极解法:当“AI导出鸭”重新定义效率边界
  • ChatGPT的LaTeX生成PDF文件复制后数学公式乱码,怎样修改?苹果用户的底层逻辑与优雅解法
  • 操作教程丨WorkBuddy 接入企业数据MCP流程与应用示例
  • 【超详细】搞懂tar、tgz、zip、rar、7z归档压缩格式,理清跨平台踩坑根源
  • MySQL基础语法解析及其在Python爬虫中的应用
  • 上线千舟报修云前后,迈得医疗工业设备股份有限公司后勤工作发生了什么?
  • Vllm LINUX部署Qwen3.8-27B多模态支持视频图片模型全流程(8张L20卡)
  • 地面站软件常用功能及页面介绍(一)
  • `import win32api`是Python调用Windows系统原生API的前置操作,依托pywin32模块可以实现各类Windows底层功能开发
  • 【第10期】Docker 基础实战:镜像、容器、端口、卷和日志到底是什么
  • GDB 调试手册
  • 全文 - Isaac ROS 06 - Getting Started
  • 上线千舟报修云前后,贵州中建秀印高速公路有限公司后勤工作发生了什么?
  • 串口收发数据包
  • 2026 年 AI Agent 框架横评:10 大框架优缺点对比 + 选型指南
  • 具身智能之通用机器人RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体
  • 电机模块注意事项