当前位置: 首页 > news >正文

视频通用模型来了!何恺明等新作GenCeption:训练量仅1/500,精度持平SOTA!

再证「生成即理解」

目录

01 视觉领域长期无解的底层痛点

02 把文生扩散改造成前馈通用感知器

2.1 核心改造:迭代扩散转为单步前馈推理

2.2 统一表征:稠密、稀疏任务共用一套3通道RGB输出空间

2.3 可规模化合成数据训练管线

03 性能、数据效率、涌现能力三重突破

3.1 多任务统一SOTA,单模型对标数十款专用专家模型

3.2 碾压级数据效率:仅竞品1/7~1/500训练量即可持平精度

3.3 三大原生涌现能力

04 工程落地价值与长远行业影响

4.1 短期落地场景价值

4.2 中长期行业变革意义

4.3 待解决开放问题

05 写在最后


大语言模型依靠自预测预训练完成大一统,但计算机视觉长期停留在“单一任务专用模型”的碎片化阶段:做深度估计要用DepthAnything,分割依赖SAM,人体姿态、相机位姿、3D关键点又要单独训练专属网络。

Google DeepMind联合MIT、牛津大学等机构在ECCV 2026发表的最新论文给出了一个颠覆性结论:

大规模文生视频扩散模型,就是视觉领域等价于LLM“下一个Token预测”的通用预训练目标。

在此基础上提出的GenCeption,用一套统一主干+统一损失,依靠文本提示就能完成深度估计、表面法线预测、分割、相机位姿估计和3D关键点预测等数十类视频感知任务。

训练数据量仅为现有SOTA模型的1/7~1/500,还诞生了仿真到真实、跨类别零样本等多项涌现能力。

01 视觉领域长期无解的底层痛点

如今计算机视觉赛道分工极度割裂,根源在于三类无法同时兼顾的历史预训练方案缺陷,这也是GenCeption全部设计逻辑的出发点。

1. 专用任务模型路线

DepthAnything、SAM、Sapiens等模型各司其职,主干、解码器、损失函数全部独立设计。新增一类感知任务就要完整重训一套网络,研发成本极高;模型之间无法复用时空、3D几何先验,对动态视频时序一致性建模能力薄弱,只能处理静态图像。

图 | DepthAnything

2. 传统自监督视觉预训练(VideoMAE、V-JEPA)

以掩码重构、特征预测为目标,缺少原生图文对齐能力,无法用自然语言指令调度任务;仅能提取视觉特征,不内置4D时空、物体物理交互先验,想要做深度、法线这类几何任务,必须额外搭建下游专用头,数据利用效率极低。

图 | VideoMAE

3. 图像扩散复用方案(Marigold、Diception)

仅基于静态图像扩散,处理连续视频时预测结果会剧烈时序抖动;只能覆盖少量稠密视觉任务,无法拓展3D关键点、相机位姿这类稀疏结构化输出,通用性存在天然天花板。

图 | Marigold

三类方案全都无法同时满足通用视觉模型三大硬性要求:内置4D时空物理先验、原生图文对齐、可规模化拓展全品类感知任务。而文生视频扩散模型的训练目标天然同时满足三点,这是GenCeption的核心立论根基。

02 把文生扩散改造成前馈通用感知器

整套框架以开源文生视频模型WAN 2.1的DiT扩散Transformer为主干,核心改造思路是抛弃扩散迭代采样,将多步去噪流程转为单步前馈推理,搭配统一表征方案、合成数据多任务微调流水线,全程一套主干、一套损失搞定所有视觉任务。

2.1 核心改造:迭代扩散转为单步前馈推理

图 | GenCeption完整架构流程图:输入视频+文本提示,单步前馈输出稠密/稀疏视觉结果

传统文生视频需要数十步迭代去噪,速度慢,不适合感知推理。GenCeption做了关键简化:输入不再是噪声潜向量,直接送入原始视频干净潜特征,时序步长固定t=0(整流流模型终止状态),仅单次前向传播输出预测。

原文整流流DiT预测速度项v,模型输出取-v即可对齐目标潜空间,无需多轮迭代。这套改造完全保留预训练阶段学到的全部时空、几何、图文先验,不改动主干网络权重结构,只调整输入输出逻辑,兼顾预训练权重复用与推理速度。

图 | 范式变迁总览图:左侧GenCeption完整技术路线,右侧传统专用模型与统一通用模型架构对比

1.3B小规模模型单段81帧480×832视频推理仅5.92秒,14B大模型10秒完成,完全满足视频实时感知需求。

2.2 统一表征:稠密、稀疏任务共用一套3通道RGB输出空间

这是实现“无任务专属网络”最关键的设计,所有视觉输出全部映射至0~1三通道像素空间,仅靠文本提示(如“输出深度”“输出3D关键点”切换任务,不用更换解码器、损失。

1. 稠密任务(深度、表面法线、分割、射线图)

单通道信息(深度图)直接复制填充RGB三通道;3维法线直接使用R/G/B分别对应XYZ三轴;相机位姿这类高维射线数据设计“罗斯科分块射线图”(图5),旋转、平移分量分区域塞入同一帧RGB画面,适配统一VAE解码器。

图 | 罗斯科射线图:将6维相机射线信息压缩至单张3通道图像

2. 稀疏任务(2D/3D人体关键点)

新增一组可学习序列Token追加至视频潜序列,经过独立轻量MLP回归坐标。为匹配预训练时序位置编码,采用位置插值适配视频长度,仅新增极少量参数,不会破坏主干预训练时空建模能力。

所有任务统一使用单一L2损失,不再为深度、分割、姿态分别设计定制损失函数。传统多任务训练需要反复调平衡权重,GenCeption直接把任务差异转移到数据预处理阶段:深度图采用对数归一化消除尺度歧义,法线统一值域,不同任务仅调整训练数据混合比例,大幅降低多任务调参成本。

2.3 可规模化合成数据训练管线

图 | 深度、法线预测定性效果示例

现实带标注高质量视频数据集稀缺,尤其是同时包含深度、法线、分割、人体关键点、相机位姿多标签素材。GenCeption完全以合成虚拟视频作为主要训练数据,仅指代分割补充少量真实数据集。

数据生成流程:采用800组人物3D资产+200套CMU动作捕捉动画,搭配多样HDRI场景、可变相机焦距生成7500段合成视频,Blender批量渲染多模态真值(深度、掩码、人体关节)。训练前统一将RGB输入、多模态目标全部编码缓存为潜向量,大幅加速训练速度。

这套数据方案的核心优势:无需大量人工标注、可无限扩充人物动作与场景,同时带来极强仿真到真实世界迁移能力,也是模型数据效率碾压竞品的关键。

03 性能、数据效率、涌现能力三重突破

实验不单纯罗列刷榜数字,分层解读指标真实价值,同时对比V-JEPA、VideoMAE等主流预训练基线,明确GenCeption行业定位。

3.1 多任务统一SOTA,单模型对标数十款专用专家模型

图 | 左:多任务雷达图(通用模型vs各领域专家模型);右:数据效率对比曲线

左雷达图覆盖表面法线、深度、相机位姿、前景抠图、文本指代分割、3D人体六大主流视频感知任务。14B GenCeption通用模型在绝大多数基准上和DepthAnything3、SAM3、D4RT、Sapiens等专用模型持平甚至超越;仅少数细分任务略低于单任务专家微调版本,但差距极小。

图 | 多任务定量对比节选

14B通用模型在Hi4D法线mAE=11.47,KITTI深度AbsRel=0.156,EMDB人体MPJPE=71.8,对比专用模型没有明显短板。

需要客观说明指标边界:现有SOTA专用模型大多采用百万级真实标注视频训练,GenCeption仅依靠少量合成数据达到同等精度,纸面性能差距意义远不及数据效率优势。

3.2 碾压级数据效率:仅竞品1/7~1/500训练量即可持平精度

图 | 数据效率曲线直观体现核心工程优势

在深度估计统一测试基准上,D4RT、VGGT-Ω需要百万级训练帧,GenCeption仅需0.9M1.23M帧,数据量缩减7500倍仍能实现相近AbsRel误差。

图 | 预训练基线横向对比

同等微调数据下,基于文生视频WAN主干的GenCeption全面超过V-JEPA、VideoMAE最大版本模型。核心原因是视频扩散预训练强制模型学习真实世界4D时序因果、物体恒存、物理交互,而掩码自监督仅学习局部视觉纹理,缺少全局几何逻辑。

图 | 迁移不同预训练层数的训练损失曲线

从零随机初始化DiT训练损失几乎不下降,随着迁移预训练层数增加,收敛速度与最终精度同步提升,完整预训练层损失最低,证明视频生成预训练得到的世界先验是通用视觉的核心底座。

3.3 三大原生涌现能力

这是传统专用视觉模型完全不具备的特性,也证明视频扩散模型学到了通用世界表征,而非单一任务拟合特征。

1. 仿真到真实零样本迁移

模型全程仅用人形合成视频训练,无需真实人物素材,直接适配户外、室内各类真实视频,深度、分割细节甚至优于渲染合成素材(图6人物发丝、动物毛发精细预测)。单物体训练,支持多实例真实场景推理

训练视频单帧仅包含单人,但输入多人、多物体真实画面,可精准区分不同目标完成分割、姿态预测(图10a)。

图 | 泛化能力效果图:多人物实例泛化

2. OOD域外类别零样本泛化

训练集只有人类,输入猫、猩猩、河马、机器人等完全未训练物体,依旧能精准输出深度、掩码、3D关键点(图10b)。

图 | 泛化能力效果图:跨类别零样本(动物、人形机器人)

指代分割测试中,训练未出现“火箭”,输入提示词the rocket仍可精准分割目标。

图 | 文本指代分割定性结果,支持颜色、空间、运动、未知物体推理

该特性意味着模型掌握物体通用几何结构,而非记忆人类专属特征,距离通用世界模型更近一步。

04 工程落地价值与长远行业影响

4.1 短期落地场景价值

1. 多模态视频分析平台

安防、影视后期、虚拟拍摄仅部署单套模型,通过提示词切换深度、抠图、人体姿态、镜头位姿分析,替代5~10款独立推理模型,大幅降低显存与算力开销。

2. 数字人、虚拟内容生产

依靠合成数据训练,无需大量真人拍摄标注,一次性完成人体法线、关键点、前景分割,大幅降低虚拟资产制作标注成本。

3. 低成本机器人视觉感知

室内机械臂、巡检机器人依靠少量仿真数据训练,同时完成深度、物体分割、关键点检测,无需分别训练感知网络,降低机器人数据采集风险与成本。

4.2 中长期行业变革意义

长久以来计算机视觉和NLP存在巨大鸿沟:NLP依靠生成式预训练实现大一统,视觉却始终任务割裂。GenCeption直接证明文生视频生成是视觉领域等价于LLM下一词预测的通用预训练范式

未来视觉基础模型不再需要分别训练分割、深度、姿态专用底座,一套文生视频预训练主干,通过统一表征+文本提示即可适配绝大多数感知任务,彻底改变视觉模型研发流水线。同时涌现的跨类别、仿真转真实能力,为通用机器人世界模型、具身智能提供全新训练路径。

4.3 待解决开放问题

平衡稠密像素输出与稀疏关键点两类任务的表征冲突,缩小通用模型与单任务专家精度差距;

  1. 拓展流式长视频推理,适配监控、自动驾驶长时序连续感知;
  2. 扩充合成数据物体、极端环境覆盖范围,提升恶劣工况、非常规物体泛化能力;
  3. 轻量化蒸馏方案,让通用视觉模型落地嵌入式边缘设备。

05 写在最后

GenCeption打破计算机视觉长期碎片化研发模式,证实大规模文生视频扩散模型内置完整4D时空、几何、图文世界先验,可作为通用视觉基础模型的预训练底座。

通过将迭代扩散改造为单步前馈架构、统一多模态输出至RGB像素空间、合成数据多任务微调三大创新,实现单主干通吃深度、法线、分割、3D人体、相机位姿等数十类视频感知任务,数据效率远超传统自监督与专用模型路线,同时诞生仿真到真实、跨类别零样本等涌现能力。

尽管通用多任务训练存在小幅精度损失、轻量化落地受限等短板,但该工作打通了“生成模型反向作为感知底座”全新技术路线,为统一通用视觉大模型、具身智能世界模型提供极具参考的完整框架,或将重塑后续视觉基础模型的研发思路。

Ref

论文标题:Video Generation Models areGeneral-Purpose Vision Learners

论文链接:https://arxiv.org/abs/2607.09024

项目链接:https://genception.github.io/

http://www.cnnetsun.cn/news/3567438.html

相关文章:

  • 毕业设计项目 深度学习Yolo11暴力行为识别系统(源码+论文)
  • Dex Retargeting项目深度解析:如何利用Python优化器实现精准的手部运动重定向
  • 小程序毕业设计-基于 SpringBoot 的高校宿舍防疫与日常管理系统 智慧校园宿舍防疫管控服务小程序设计(源码+LW+部署文档+全bao+远程调试+代码讲解等)
  • 未来展望:从NAACL 2019到现在的迁移学习技术演进
  • 具身智能之Xiaomi-Robotics-1:如何把 VLA 的规模化落到真实机器人
  • AI4R隐藏马尔可夫模型:用Ruby破解序列预测难题
  • 告别复杂软件:noteDigger如何用纯前端技术重新定义音乐扒谱体验
  • Colorcet高级技巧:如何自定义、反转和组合色图以适应复杂数据场景
  • 人生的九重觉悟
  • GO_并发编程---select
  • Autotest服务器配置指南:搭建多机器分布式测试环境
  • 如何在华为HarmonyOS设备上免费使用Google服务:microG完整配置指南
  • 服装点钻机选型技术解析:三大核心标准与工程化验证
  • eDBG安全调试实践:10个避免被检测的实用技巧
  • Buzz:离线语音转录与翻译的现代化技术架构解析与应用实践
  • 掌握RAG,让程序员小白轻松驾驭大模型:收藏必备的实战指南
  • 汽车座舱开发上云 Google的Arm实例解决了什么实际问题
  • geoip版本迁移指南:从旧版本升级到最新版的注意事项和步骤
  • 现代C++设计模式中文版:从零开始掌握23种经典模式的终极指南
  • Hugging Face 被 AI Agent 攻破内幕:一个数据集、上千次沙盒逃逸、自迁移 C2——AI 安全还没准备好
  • OOTDiffusion虚拟试衣终极指南:从零搭建AI换装系统
  • Spring Boot 3 + Vue 3 + MySQL 苗族刺绣数字化平台源码 前后端分离实战项目
  • Alfred-Convert单位转换库对比:与其他转换工具的优劣势分析
  • GameHackingCode核心组件剖析:从内存访问到控制流劫持的终极指南
  • ZotMoov插件终极指南:如何高效管理Zotero文献附件的完整解决方案
  • 非编码RNA研究的时代突破与未竟之问
  • 什么是GEO?一文读懂生成式AI搜索引擎优化
  • HarmonyOS趣味相机实战第24篇:前摄镜像、旋转补偿与识别框坐标统一
  • swtpm与QEMU完美结合:构建安全可靠的虚拟化TPM环境终极指南
  • 颠覆传统,计算器只输出最终计算结果,编写程序,保存全部计算草稿步骤,从演算过程里寻找可以简化或者重构的创新算法。