当前位置: 首页 > news >正文

V-JEPA: 从视频帧到3D时空Token,V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余

从视频帧到3D时空Token:彻底理解V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余的直觉教程

从视频帧到3D时空Token

1. 第一件事情:视频为什么不能直接扔进 ViT?

普通 ViT 本质上处理的是:

Token Sequence\text{Token Sequence}Token Sequence

而一段视频原始是:

T×H×W×3T\times H\times W\times3T×H×W×3

其中:

  • TTT是帧数;
  • HHH是图像高度;
  • WWW是图像宽度;
  • 333是 RGB 三个通道。

因此必须先把视频切成很多小块,再把这些小块变成 Token。

但图片只有空间:

H×WH\times WH×W

视频则有:

T×H×WT\times H\times WT×H×W

所以 V-JEPA 不再切二维 Patch,而是切三维时空 Patch(3D Spatio-temporal Patch)


2. V-JEPA 的一个 Token 到底是什么?

V-JEPA 默认的基本 Patch 尺寸为:

2×16×16\color{red}{2\times16\times16}2×16×16

顺序是:

Time×Height×Width\text{Time}\times\text{Height}\times\text{Width}Time×Height×Width

也就是说:

  • 时间方向包含连续222帧;
  • 高度方向包含161616像素;
  • 宽度方向包含161616像素。

因此一个 Token 不是:

“某一帧里面一个16×1616\times1616×16小方块”。

而是:

“同一个空间小区域,在连续两帧中的内容”。

这种跨时间的小立方体也常被称为Tubelet(时空管状块)。V-JEPA 官方模型配置使用2×16×162\times16\times162×16×16的时空 Patch。


3. 用真正直观的六帧视频理解 Tubelet

假设我们有一个非常小的视频:

T=6,H=W=32T=6,\qquad H=W=32T=6,H=W=32

每一帧只有:

32×3232\times3232×32

像素。

空间 Patch 大小是:

16×1616\times1616×16

所以每一帧可以切成:

2×22\times22×2

四个小方块。

先不要急着生成 Token。

我们先把原始6 帧全部画出来。

时间轴 │ │ ▼ Frame 1 Frame 2 ┌──────────┬──────────┐ ┌──────────┬──────────┐ │ 1-a │ 2-a │ │ 1-b │ 2-b │ │ 左上16×16│ 右上16×16│ │ 左上16×16│ 右上16×16│ ├──────────┼──────────┤ ├──────────┼──────────┤ │ 3-a │ 4-a │ │ 3-b │ 4-b │ │ 左下16×16│ 右下16×16│ │ 左下16×16│ 右下16×16│ └──────────┴──────────┘ └──────────┴──────────┘ Frame 3 Frame 4 ┌──────────┬──────────┐ ┌──────────┬──────────┐ │ 5-a │ 6-a │ │ 5-b │ 6-b │ │ 左上16×16│ 右上16×16│ │ 左上16×16│ 右上16×16│ ├──────────┼──────────┤ ├──────────┼──────────┤ │ 7-a │ 8-a │ │ 7-b │ 8-b │ │ 左下16×16│ 右下16×16│ │ 左下16×16│ 右下16×16│ └──────────┴──────────┘ └──────────┴──────────┘ Frame 5 Frame 6 ┌──────────┬──────────┐ ┌──────────┬──────────┐ │ 9-a │ 10-a │ │ 9-b │ 10-b │ │ 左上16×16│ 右上16×16│ │ 左上16×16│ 右上16×16│ ├──────────┼──────────┤ ├──────────┼──────────┤ │ 11-a │ 12-a │ │ 11-b │ 12-b │ │ 左下16×16│ 右下16×16│ │ 左下16×16│ 右下16×16│ └──────────┴──────────┘ └──────────┴──────────┘
时间 T ↑ │ │ Frame 6 │ ──────────┼────────── / /| / 9-b 10-b / | / 左上16×16 右上16×16/ | ├──────────┬──────────┤ | / 11-b / 12-b / | / 左下16×16/ 右下16×16 / | └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 5 | ────────── | / /| | / 9-a 10-a / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 11-a / 12-a / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 4 | ────────── | / /| | / 5-b 6-b / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 7-b / 8-b / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 3 | ────────── | / /| | / 5-a 6-a / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 7-a / 8-a / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 2 | ────────── | / /| | / 1-b 2-b / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 3-b / 4-b / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 1 / ────────── / / / / 1-a 2-a / / 左上16×16 右上16×16/ ├──────────┬──────────┤ / 3-a / 4-a / / 左下16×16/ 右下16×16 / └──────────┴──────────┘ ↓ Height / 高度 Width / 宽度 →

注意这里暂时用ab表示某个 Token 中来自不同帧的空间切片。


4. 现在把相邻两帧的同一个空间位置粘在一起

Tubelet 的时间大小是222,所以:

  • Frame 1 和 Frame 2 被配成一组。
  • Frame 3 和 Frame 4 被配成另一组。
  • Frame 5 和 Frame 6 被配成第三组。

例如左上区域:

Frame 1 Frame 2 ┌──────────────┐ ┌──────────────┐ │ │ │ │ │ 1-a │ =========> │ 1-b │ │ 16×16 │ 时间 │ 16×16 │ │ │ 深度=2 │ │ └──────────────┘ └──────────────┘ \____________________________/ │ ▼ Token 1 2×16×16

所以:

Token 1={ Frame 1 左上,Frame 2 左上}\text{Token 1}=\{\text{Frame 1 左上},\text{Frame 2 左上}\}Token 1={Frame 1 左上,Frame 2 左上}

同理:

Token 2={ Frame 1 右上,Frame 2 右上}\text{Token 2}=\{\text{Frame 1 右上},\text{Frame 2 右上}\}Token 2={Frame 1 右上,Frame 2 右上}

Token 3={ Frame 1 左下,Frame 2 左下}\text{Token 3}=\{\text{Frame 1 左下},\text{Frame 2 左下}\}Token 3={Frame 1 左下,Frame 2 左下}

Token 4={ Frame 1 右下,Frame 2 右下}\text{Token 4}=\{\text{Frame 1 右下},\text{Frame 2 右下}\}Token 4={Frame 1 右下,Frame 2 右下}

而 Frame 3 和 Frame 4 得到:

Token 5,Token 6,Token 7,Token 8\text{Token 5},\text{Token 6},\text{Token 7},\text{Token 8}Token 5,Token 6,Token 7,Token 8

Frame 5 和 Frame 6 得到:

Token 9,Token 10,Token 11,Token 12\text{Token 9},\text{Token 10},\text{Token 11},\text{Token 12}Token 9,Token 10,Token 11,Token 12


5. 这就是之前为什么会画成三个矩阵

Tubelet 化之后,原来的:

6×32×326\times32\times326×32×32

视频在 Token 空间里变成:

3×2×23\times2\times23×2×2

为什么?

时间:

T′=62=3T'=\frac{6}{2}=3T=26=3

高度:

H′=3216=2H'=\frac{32}{16}=2H=

http://www.cnnetsun.cn/news/3955705.html

相关文章:

  • 从Claude Code迁移到Cursor Cli:构建终端AI编程工作流
  • OpenClaw云服务器AI工具链:一键部署与智能运维实战
  • title3技术实践:模块化架构与高效开发指南
  • 为什么draw.io桌面版是跨平台图表工具的最佳选择?
  • 【Java核心高阶进阶】25-AQS原理深度剖析
  • SpringBoot3集成Shiro常见问题与解决方案
  • 如何为Jellyfin配置智能字幕系统:完整指南与最佳实践
  • 如何快速掌握txtai:面向开发者的完整AI框架指南
  • ComfyUI-WanVideoWrapper终极指南:5步掌握AI视频生成可视化工作流
  • LoopEngineering:渐进式重构方法论,四步循环改造遗留系统
  • LinkSwift:九大网盘直链解析助手,告别下载限速烦恼
  • 从Jupyter到K8s:Agent开发环境到生产环境的完整迁移指南
  • Python方程计算器开发指南:从基础到高级应用
  • 酒店小程序系统架构设计与高并发实践
  • 海淀区科技创新生态:顶天立地与铺天盖地的双轮驱动
  • 重塑数字主权:Win11Debloat如何重新定义Windows体验治理范式
  • 高性能网络延迟测试利器:sockperf深度指南 [特殊字符]
  • 引力模型实战:从铁路暑运4.32亿人次与西十高铁客流看城市间客流预测
  • 终极Jellyfin字幕管理指南:轻松实现多语言自动下载和同步
  • A2B AD2433 ADXL317调试总结
  • 2026年GEO营销系统哪个牌子口碑好?从认知辨析到品牌测评
  • 从js闭包谈到作用域、作用域链、执行上下文、内存管理
  • KernelSU WebUI终极指南:让Android模块管理像打开网页一样简单
  • WeKnora:5分钟快速上手的终极RAG智能文档处理框架,彻底告别信息碎片化
  • 好“哪些资料能入库”
  • GSE:魔兽世界终极宏编辑器完整指南 - 告别繁琐按键操作
  • notify开发实战:如何为新平台贡献适配器?
  • Protolint完全指南:如何用这款插件化工具统一你的Protocol Buffer代码风格?
  • 华为MetaERP PO‑采购接收‑接收检验‑入库 全流程会计核算、SAP / Oracle EBS / Fusion 对比、中国准则审计税法深度分析业务四环节:采购下单 PO(无会计凭证)→采购接
  • 3个技巧让Windows窗口管理效率翻倍:FancyZones深度指南