InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解
InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解
【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B
InternVL3.5-4B 是 OpenGVLab 开源的轻量级多模态大模型,总参数量约 4.7B,采用经典的「ViT-MLP-LLM」架构:InternViT-300M 视觉编码器 + MLP 投影层 + Qwen3-4B 语言模型。本文逐层拆解这套多模态范式的实现细节,讲清它如何把一张图片变成视觉 token 序列并交给 LLM,帮助新手彻底看懂轻量级 VLM 的架构原理。
💡 30 秒概览:三个「零件」拼成一个模型
| 组件 | 模型 | 参数量 | 职责 |
|---|---|---|---|
| 视觉编码器 | InternViT-300M | 0.3B | 切图、提取视觉特征 |
| 投影层 | Pixel Shuffle + MLP | 约几 M | 压缩视觉 token、对齐维度 |
| 语言模型 | Qwen3-4B | 4.4B | 多模态理解、推理与生成 |
关键数字:每个 448×448 图像切片最终转换为256 个<IMG_CONTEXT>视觉 token;一张原图会被动态切成1~12 个切片 + 1 张缩略图(见config.json中的max_dynamic_patch=12、downsample_ratio=0.5)。
📐 数据流全景:一张图如何变成回答
- 动态切图:按最接近的宽高比把原图切成 1~12 个 448×448 切片,再附一张缩略图;
- 视觉编码:每个切片进入 InternViT(24 层 Transformer),448÷14=32,得到 32×32=1024 个 patch 特征 + 1 个 CLS token;
- token 压缩:pixel shuffle 把 1024 个 token 压成 256 个(每个 token 维度变为 4 倍);
- 投影对齐:
mlp1把 4096 维映射到 Qwen3 的 2560 维; - 占位替换:输入 embedding 序列中的
<IMG_CONTEXT>占位符逐个换成视觉特征(见modeling_internvl_chat.py的forward); - 自回归生成:Qwen3-4B 基于「文本 + 视觉」混合序列生成回答。
🔍 第一层:InternViT 视觉编码器
实现在modeling_intern_vit.py,关键参数来自config.json的vision_config段:
| 参数 | 值 | 含义 |
|---|---|---|
| num_hidden_layers | 24 | Transformer 层数 |
| hidden_size | 1024 | 隐层维度 |
| num_attention_heads | 16 | 注意力头数 |
| patch_size | 14 | 切片窗口大小(像素) |
| image_size | 448 | 每个切片分辨率 |
| hidden_act / norm | gelu / layer_norm | 激活与归一化方式 |
几个值得留心的设计细节:
- 可插值位置编码:
_get_pos_embed用双三次插值把 32×32 的位置编码表重采样,因此任意尺寸的切片都能拿到合适的位置信息; - LayerScale + DropPath:每层带
ls1/ls2缩放参数和随机深度(drop_path_rate=0.1),让大视觉编码器训练更稳; - FlashAttention 加速:配置了
use_flash_attn=true,自注意力走flash_attn_varlen_qkvpacked_func快速路径。
「动态高分辨率」由config.json中dynamic_image_size=true、min_dynamic_patch=1、max_dynamic_patch=12、use_thumbnail=true共同控制:小图只切 1 块,信息量大的图表、文档则最多切 12 块「看得更仔细」,兼顾精度与开销。
🧮 第二层:MLP 投影层——视觉与语言之间的「翻译官」
这是 ViT-MLP-LLM 中「MLP」的核心,位于modeling_internvl_chat.py的InternVLChatModel.__init__:
- pixel shuffle(
downsample_ratio=0.5):把 32×32 网格的 1024 维特征重排为 16×16 网格的 4096 维特征,token 数从 1024 压到 256,序列长度骤降 4 倍; - mlp1:
LayerNorm(4096) → Linear(4096→2560) → GELU → Linear(2560→2560),完成到 Qwen3 隐层维度的对齐。
算一笔账:一张 12 切片 + 缩略图的图像会注入 256×13 =3328 个 token——这就是多模态对话为什么特别「吃」上下文窗口的原因。
🤖 第三层:Qwen3-4B 语言模型
参数定义在config.json的llm_config段(架构为Qwen3ForCausalLM):
| 参数 | 值 | 参数 | 值 |
|---|---|---|---|
| num_hidden_layers | 36 | hidden_size | 2560 |
| num_attention_heads | 32 | num_key_value_heads | 8(GQA) |
| intermediate_size | 9728 | max_position_embeddings | 40960 |
| rope_theta | 1,000,000 | vocab_size | 151,936 |
| hidden_act | silu | attention_bias | false |
两个亮点:分组查询注意力(32 个 Q 头共享 8 个 KV 头)显著降低推理时的 KV 缓存占用;40K 上下文足以容纳多张高分辨率图 + 长文档对话。
🏋️ 训练管线:四步走到最终版本
据README.md说明,InternVL3.5-4B 依次经历:
- CPT(多模态持续预训练):文本 + 多模态语料联合训练,配合平方根加权的最下一个词预测损失;
- SFT(监督微调):32K 上下文,引入「思考模式」推理数据;
- MPO(离线强化学习):DPO + BCO + LM 三项损失组合——当前仓库模型的直接基座(
README.md中base_model指向InternVL3_5-4B-MPO); - GSPO(在线强化学习):级联强化学习收尾,MMMU、MathVista 等推理基准大幅提升。
🚀 快速上手:最低门槛的部署方式
环境要求transformers>=4.52.1,单张 24G 显存 GPU 即可跑起来(官方说明 30B 及以下可单卡 A100 部署,4B 更轻松):
import torch from transformers import AutoModel, AutoTokenizer path = "OpenGVLab/InternVL3_5-4B" model = AutoModel.from_pretrained( path, torch_dtype=torch.bfloat16, low_cpu_mem_usage=True, use_flash_attn=True, trust_remote_code=True, device_map="auto").eval() tokenizer = AutoTokenizer.from_pretrained(path, trust_remote_code=True) question = '<image>\nPlease describe the image shortly.' # pixel_values 由动态切图得到(完整示例见 README.md 的 load_image) response = model.chat(tokenizer, pixel_values, question, dict(max_new_tokens=1024, do_sample=True))要开启「思考模式」,只需把系统提示词换成官方 R1 提示并设置do_sample=True、temperature=0.6。在线服务场景可直接用 vLLM 或 LMDeploy 起 OpenAI 兼容 API:lmdeploy serve api_server OpenGVLab/InternVL3_5-4B --server-port 23333 --tp 1。
📁 关键文件速查
| 文件 | 作用 |
|---|---|
config.json | 顶层配置 +vision_config+llm_config三段式结构 |
modeling_intern_vit.py | InternViT 视觉编码器(Embeddings / Attention / Encoder) |
configuration_intern_vit.py | ViT 配置类(本模型覆盖为 24 层) |
modeling_internvl_chat.py | 主模型:pixel shuffle、mlp1、chat / generate 逻辑 |
configuration_internvl_chat.py | 组合式配置,把 vision 与 LLM 配置拼装在一起 |
conversation.py | 对话模板(本模型使用internvl2_5模板) |
special_tokens_map.json | <img>、<IMG_CONTEXT>、<box>等特殊 token |
chat_template.jinja | 新版 transformers 的聊天模板 |
📌 写在最后
InternVL3.5-4B 用 4.7B 的体量证明:ViT-MLP-LLM 范式简单却高效——InternViT 负责「看」,pixel shuffle + MLP 负责「压缩」,Qwen3-4B 负责「想与说」。动态高分辨率切图让它能看清细节,级联强化学习训练让它具备数学与图表推理能力,是理解开源多模态大模型架构的绝佳入口。
【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
