当前位置: 首页 > news >正文

AutoToken:视觉-语言预训练中的视觉Tokenizer

以下为原文完整复述,可直接复制到 CSDN:

AutoToken:可扩展视觉-语言预训练中的视觉Tokenizer 深度分析

1. 视觉Tokenizer的组成部分

AutoToken论文(“AutoToken: Learning to Tokenize for Scalable Vision-Language Pretraining”)提出了一种面向大规模视觉-语言预训练的视觉Tokenizer。该Tokenizer本质上是一个图像/视频离散自动编码器,包含以下关键组件:

  • 编码器(Encoder):将输入图像或视频帧映射到紧凑的潜在表示。AutoToken的编码器采用类似残差网络(ResNet)结构的卷积神经网络,并结合视觉Transformer的表征能力。默认配置下包括4个残差块用于逐步下采样。编码器将高维像素数据压缩为低分辨率的特征映射。例如,对于512×512512\times512512×512图像,编码器下采样因子为16,输出32×3232\times3232×32的特征图(即1024个潜在特征)。编码器输出的每个特征向量将在量化模块中被离散化为最接近的代码向量。

  • 代码本(Codebook)与量化模块:采用向量量化(VQ)的离散化机制,将连续的编码器特征映射到有限离散代码。AutoToken使用索引反传量化(Index Backpropagation Quantization, IBQ)方法改进传统VQ。代码本包含KKK个可学习的嵌入向量(代码向量);AutoToken在训练时令编码器输出ze\mathbf{z}_eze与代码本中所有向量计算距离,选择最近的一个编码ei\mathbf{e}_iei作为量化结果zq\mathbf{z}_qzq。与传统VQ-VAE不同的是,IBQ对整个代码本进行联合优化,通过对编码特征与代码的一阶近似直通估计(straight-through estimator)来反传梯度。也就是说,将编码ei\mathbf{e}_ieione-hot选择视为可微分的参数,使所有代码向量在每次反传中都被更新,保持编码器输出分布与代码本嵌入空间的一致。这种方法避免了仅部分代码被更新导致的“代码本塌陷”,显著提高了代码本利用率(达到约96%)。AutoToken因此可以扩展到大规模代码本(如218=2621442^{18}=2621442

http://www.cnnetsun.cn/news/1551929.html

相关文章:

  • SDMatte+边缘细化算法解析:CRF后处理与亚像素级轮廓校准机制
  • 新手零压力上手:在快马平台跟随交互式教程完成openclaw安装与第一个爬虫
  • 参数化音频均衡:Equalizer APO开源工具的全面技术指南
  • GLM-4v-9b多模态实战:直播带货截图→商品卖点提取+话术优化建议
  • 无需代码!用Whisper搭建语音识别Web服务:支持上传和录音
  • MogFace-large惊艳效果展示:HCAM模块显著降低误检率实测
  • WebSocket太复杂?试试SSE:5分钟搭建一个实时数据推送服务
  • Go 服务注册与发现方案
  • 自媒体人必备!FUTURE POLICE快速给视频加字幕全流程
  • AI头像生成器GPU算力优化:Qwen3-32B FlashAttention-2加速后吞吐提升2.3倍
  • GLM-OCR模型GitHub开源项目实战:参与贡献与自定义训练指南
  • Qwen3-1.7B智能语音助手:完整部署流程与代码实战
  • 奥克斯2025年营收300亿:净利22亿 同比降23%
  • 跨平台文件同步方案:OpenClaw+Qwen3-32B智能归档系统
  • 雪女-斗罗大陆-造相Z-Turbo模型推理背后的计算机组成原理浅析
  • OpenClaw内存优化方案:Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-GGUF在低配设备上的运行技巧
  • 算法复盘——二分查找
  • 卷积神经网络(CNN)原理与PyTorch 2.8实现:图像分类从入门到精通
  • DeepSeek-R1-Distill-Llama-8B功能体验:数学、代码、推理全搞定
  • 手把手教你:在无外网Linux服务器上,用Ollama离线部署CodeQwen-7B大模型(附Modelfile避坑指南)
  • N_m3u8DL-RE完全指南:3分钟解决流媒体下载难题的终极方案
  • 告别Keil!在Ubuntu 20.04上用Eclipse搭建GD32开发环境(保姆级图文教程)
  • 无人机国标协议接入故障深度分析与系统性解决方案
  • 百川2-13B-4bits量化版效果展示:JSON格式返回、表格对比、Markdown代码块原生支持
  • GLM-OCR文件处理进阶:C语言实现批量图片读取与识别结果输出
  • 终极番茄小说下载器:Rust重构的高效电子书下载解决方案
  • 基于Matlab的语音信号加密解密传输系统:支持GUI界面与自定义密码保护
  • YOLOv9镜像快速上手:一行命令跑通推理,小白也能玩转目标检测
  • 3分钟上手!AI驱动的代码学习助手完全指南
  • Qwen2-VL-2B-Instruct应对“耦合过度”设计:从UML图中识别代码坏味道