EMMA框架如何从视频、声音和图像中还原真实物理规律
此项研究是从亚利桑那州立大学计算与增强智能学院, 也就是SCAI实验室开展的, 论文预印本是在2026年5月21日, 于arXiv平台发布了, 其编号是arXiv:2605. , 该研究方向是隶属于计算机视觉领域, 也就是cs.CV的, 研究成果打算在CVPR 2026上进行展示。感兴趣的读者呢, 可以凭借上述编号在arXiv检索完整的论文。
**一个关于"侦探"的故事**
要是你被设定为一名早已经验充沛的侦探, 被要求仅仅凭借一段监控录像去判定一辆赛车的发动机功率, 去判断其轮胎摩擦系数, 去确定车身重量, 以及去弄清楚驾驶员在录像之外到底踩了多深的油门。这听起来好似天方夜谭, 毕竟好多关键信息压根就没有呈现在画面之中。然而, 一旦你同时还能够听闻发动机传来的声音录音, 甚至于手边竟然还有一张印着发动机转速曲线的图表, 那么破案的成功概率就会大幅度提高。
拥有这般思维的, 是亚利桑那州立大学的研究团队, 他们成功构建了一个被称作**EMMA**( from Data, 也即从多模态数据里提取多个物理参数)的系统。像具备“看”“听”与“读图”能力的物理侦探一般, 这个能够从视频的展现画面环境 的声音 以及图表的图像里头, 将控制了 着运行的 诸如 长、 摩擦 的系数、 电机的增益、 无人机的推力系数等 各式各样参数自动还原出来的系统, 并且在机器人或者无人机上不安装任何昂贵传感器的情况下,就能达成这一系列操作。
普通人为何值得关注这件事呢? 追根溯源, 物理参数的提取是构建“数字孪生”(twin, 也就是真实系统的虚拟复制品)的核心所在。当一台火星探测车启程奔赴未知之地时, 工程师在地球上需要有一个完全一样的数字副本用以开展仿真测试。当一架快递无人机出现故障时, 维修人员要能够精准还原出飞行器的物理特性才行, 才可以诊断出问题处于何处。以往, 这样的还原过程需要众多精密仪器, 代价不菲且操作繁杂。EMMA出现了, 这意味着, 仅仅用一部普通摄像机拍摄的视频, 再增添一个麦克风, 接着加上一张从报告里截取下来的图表, 一台普通电脑就能够完成这项工作。
“单靠眼睛”为何不够用呢, 这是视频单模态方法存在的天然局限。
学术界在EMMA出现之前, 就已有不少研究尝试仅凭视频画面估算物理系统参数, 像追踪钟摆摆动轨迹推算摆长与阻尼系数, 或者分析滑块在斜面上运动推算加速度, 这些工作于受控环境有不错成绩, 然而在真实世界却常碰壁。
问题究竟出在了哪里呢, 关键之处在于视频乃是“眼睛所看到的”, 然而众多影响运动的因素根本就不会在画面当中呈现出来。就拿一辆遥控小车作为例子来说, 摄像机能够记录下它在地面上的移动轨迹, 可是它的车轮转速是由电机进行控制的, 并且电机所接收到的指令信号从来都不会在画面里出现——这便是所说的“隐藏驱动输入”(input)。仅仅凭借视频轨迹去推算车辆参数, 就好似你看到一个人在行走, 却不清楚他走路的目的地以及他的体力状态, 所以对于他走了多远的估计就会出现严重的偏差。
与此同时, 存在着另一类更为隐蔽的物理效应, 研究团队将其称作“隐式动力学”。举例来说, 地面对车轮有着摩擦阻力, 空气对无人机机身存在阻力, 这些力既不会于视频里直接呈现, 也难以借由普通传感器进行测量, 然而它们切实地对物体的运动产生着影响。倘若不把这些因素纳入考虑范围, 估算得出的物理模型犹如缺失了几块拼图, 始终无法还原完整的真实世界。
进一步来讲, 存在着一个更为细微却同样具备致命性的问题, 那就是:坐标系。摄像机并不清楚拍摄对象的绝对位置, 也不明白“起点”究竟处于何方, 同时也不知道画面里的像素坐标怎样去对应真实世界的物理坐标。众多现有的方法都悄然假定这些信息是已知的的, 然而在现实当中情况常常并非如此。EMMA的目标, 便是要将这些“未知的已知”也一同还原出来, 从而让最终的物理模型切实具有意义。
二爱玛的啥侦探工具箱那是三条信息通道所进行的协同作战呀。
是EMMA的核心思路, 即一个好侦探不会只依赖一种证据。它同时接收三种输入, 分别是视频画面, 还有音频信号, 以及从图表或图像中提取的时间序列数据。每种输入都经过经过专门设计的处理流程, 最终汇聚成统一的“物理线索库”。
EMMA的第一条通道是视频处理流程, 它专门负责“用眼睛看”。系统首先会调用(一种成熟的目标检测工具)在每一帧画面里找到感兴趣的物体, 所设置的识别置信度阈值为0。85, 太高的话会致使大量帧被丢弃, 太低的话则会引入噪声。物体被找到后, 系统借助三层过滤机制, 将位于边缘附近的噪声检测结果给剔除掉, 之后使用卡尔曼滤波器, 也就是一种专门旨在平滑轨迹的数学工具, 对包括位置以及速度的追踪状态实施减少抖动的操作, 接着依据具体场景开展坐标转换: 像是针对摆锤而言, 得把像素坐标转化成角度;针对移动物体说, 要做精度校准。此后再运用加权移动平均来消除噪声, 从而获取干净的物理坐标时间序列。值得一提的是, 研究团队还验证了一种替代方案, 这种方案完全不依赖预训练检测器, 它是法内巴克光流法( flow), 这种方法完全无监督, 同样能达到接近的精度, 它进一步证明, EMMA的核心价值在于后端的物理推理, 而不是前端所用。特定的特征提取工具是前端使用的, 不是后端, 不是它用了哪种特定的特征提取工具, 而是后端的物理推理才是核心价值所在。
第二条通道是音频处理流程, 它赐予EMMA“用耳朵听”的能力。原始音频按44.1 kHz采样率被录制, 经降采样至22.05 kHz, 接着利用工具库运算短时傅里叶变换(STFT)且提取均方根能量、频谱质心与主导峰值频率这三个特征。随后这些特征借由自动校准模块贴合到视频帧的时间轴上。当中具备一项关键的先验假设, 即针对地面车辆的车轮以及非飞行状态下的旋翼而言, 电机转速跟声音的主导频率之间存有近似线性的关系, 就如同电风扇转动得越快, 嗡嗡声的音调便越高。EMMA凭借这个关系, 将声音里的频率信息转化成电机转速的估计值, 进而弥补视频中无法看到电机指令的缺陷。此线性关系里的两个系数, 也就是斜率和截距, 其本身亦是需要估算的“不变量”, 是由后端的神经网络自动学习的。
第三条通道是图像处理流程, 它可使EMMA能够“读懂图表”。对于从仿真器生成的图表、医疗传感器的显示图像或者其他带有曲线的图片, 系统运用PIL(图像库)与(计算机视觉库)的组合: 先加载图像, 接着裁剪感兴趣区域, 随后进行颜色空间转换以及对比度归一化, 之后借助颜色掩码隔离目标曲线, 最终把曲线离散化为带时间戳的数值序列。这表明即便不存在任何传感器, 仅仅凭借一篇论文里的一张结果图, EMMA也能够从中提取物理参数。
三条通道输出, 在时间轴上对齐, 之后拼接成统一多模态特征向量, 每个时刻对应一个长度为100的向量, 通过空间编码把各模态轨迹离散化为100个采样点。缺失模态用零填充或学习到的嵌入向量代替, 确保系统在只有部分数据时能正常运行。
三、EMMA的那个叫作液态时间常数网络的“大脑”, 是怎样学习物理规律的呢。
把所有线索收集完毕之后, 侦探还得要有一套推理机制才能够得出结论。EMMA的推理核心是一种特殊的神经网络, 它被称作**液态时间常数网络**( Time- , 简称为LTC网络), 另外还有一个全连接层, 这个全连接层负责输出最终参数。
处理时间序列数据呀, 普通神经网络通常把时间视作一格格离散步骤, 好似翻相册那样, 一张张去看。然而LTC网络却并非如此, 它在连续时间里运行, 其内部有着一个微分方程, 用以描述“记忆”会怎样随时间演化。更为关键的是, LTC的时间常数(可以理解成“记忆的衰退速度”)并非是固定不变的, 而是会随着输入信号的改变而进行动态调整的。详细来讲, 每一个神经元的动态方程涵盖两部分, 其中一部分和输入信号存在关联, 专门用以对外部驱动力(像是电机指令)做出建模, 另外一部分是包括更多变量的一组隐式动态方程, 其变量数量远远超过系统实际所需测量的状态数, 所以天然拥有对隐式动力学(比如摩擦力)进行建模的能力。
以一种比喻去领会, 要是将平常的循环神经网络视作一个仅仅会依照节拍鼓掌的鼓手, 那么LTC网络好似是一个能够依据现场音乐的情绪随时调整节奏以及力度的爵士鼓手, 其响应的方式自身就是音乐, 也就是物理规律的一部分。
研究团队开展了LTC与两种同类的连续时间神经网络的对比, 它们分别是ODE, 即神经常微分方程, 以及CT-GRU, 也就是连续时间门控循环单元。在没有外部驱动力的简单场景当中, 像单纯的钟摆这种情况, 三种架构的表现不相上下。然而, 一旦引入外部驱动力, 比如遥控小车, LTC网络的平均参数误差相比ODE低了约25%, 相较于CT-GRU低了约5%, 这显示出输入依赖型时间常数对于建模受迫动力学具有关键优势。
LTC网络所输出的隐状态向量, 接下来会传入两层全连接网络, 以此进行参数解读。能够负责估算物理参数的那一大部分情况内, 会采用激活函数这种情况, 进而把输出全部压缩到0跟1之间, 之后再借助一个特定的反归一化公式, 最终还原到物理量纲之上。而对于负责估算校准不变量这一方面来说, 校准不变量是坐标原点产生偏移这一变量、音频线性变换系数等这些, 在这部分中会采用ReLU激活函数, 这些参数会随着损失梯度呈现线性变化这种状况, 依据这种情况允许系统能够自动学习坐标系怎么样完成对齐的方式, 从而不再依靠人工标注的初始条件。由AdamW优化器协同余弦退火学习率调度来开展端到端训练的整个系统, 是全然无需提供参数的真实标签的, 学习是由完全由物理方程驱动的损失函数来引导的。
**四、EMMA的那个“判案时候所依据的标准”——借助物理方程来驱动运行且决定作用状况性质的那种损失函数 **。
若要问那学习过程倘若不需要参数的标准答案这回事, 那系统凭借啥从而知晓自身猜对了呢, 给出的答案是, 是那物理方程自身便属于标准答案。
EMMA的训练损失是由两部分构成的。其中, 第一部分叫作校准轨迹损失, 那就是把当前估算出来的参数代入已知的物理方程, 接着使用4阶龙格 - 库塔积分器(这是一种用于数值求解微分方程的方法, 它比简单的欧拉法精度要高得多, 对于无人机这种刚性较强的系统而言尤为关键重要)向前仿真得出预测轨迹, 随后再跟从视频或音频及图像里提取的实测轨迹做比较, 进而计算均方误差。这里存在着一个精妙独特的设计, 便是只有实际被测量到的状态变量才会参与到这个损失的计算中, 而未被测量的隐式状态不会造成虚假的惩罚。同时, 每个状态变量都配备有一个校准偏移量, 这个校准偏移量是由ReLU层输出的, 它能够自动补偿坐标系原点的未知偏移。
第二部损失是参数约束方面的分: 用以确保经ReLU惩罚函数估算出的参数符合物理约束通过它呀比如需保证摆长是正值, 摩擦系数处于合理区间范畴内这种软约束避免优化进程趋向于物理上不合理的解从而实现收敛。
仿真的时间步长, 被限定于min(0.03, 1/fps) , 仿真的步数, 存在最多500步的情况, 参数借助软截断, 维持在ε=10??之上, 以此来确保数值的稳定性。整个训练的过程, 窗口大小是16帧, 步长为1, 批大小是32, 耐心参数为40个周期(也就是说验证损失超过40个周期没有得到改善, 便会触发学习率的调整), 率为0.3。
五、EMMA的“破案档案”, 是关于五类物理系统的全面验证。
此研究团队, 针对EMMA展开系统评估工作, 评估场景, 超出了100个, 这些场景, 包含了三大类别, 分别为标准基准测试, 真实世界平台, 以及仿真图表。
第一种类型是依照数据集的标准基准测试, 总共有75个视频, 这75个视频覆盖了五种经典物理体系。在钟摆实验里, 该系统需要同时去估算摆长L以及阻尼系数τ, 存在45cm、90cm、150cm这三种摆长配置情况, 并且每种配置都有5个视频。处在所有形态下之时, EMMA都近乎为实际情形, 像在处于150cm形态当中时所估算出来的即是1.501±0.004m , 而实实在在情况则为1.5m, 然而针对与之进行对照关联的模式是PAIG的看法对全部摆幅给出情况较高类似评价, 不存在将伴随摆幅变化而实现分辩, NIRPI所造成的差错要更为增大而且偏差量要更高等情况存在, 于处在极端摆下这种状况时候显得跟实际情形存在倾斜 , 是基于对含有噪声的信息做出数值微分这种原因所导致的, 所估算的结果在变化量方面极为大。
托里切利排水实验所估算的是排水系数k, 其涉及到有√h这般的分数次方非线性情况, 因难以去表示这种结构所以出现了系统性误差, 而EMMA却是凭借物理约束损失稳定地在低方差态势下匹配真实值(就好比在小容器配置情形下估算为0.0093±0.0004, 真实值是0.0095)。滑块实验需要同时对坡角α以及摩擦系数μ进行估算, EMMA在低、中、高三种坡度状况下均要优于对比方法, 其参数估计颇为稳定。在LED衰减实验里, EMMA于快速衰减模式、中速衰减模式以及慢速衰减模式这三种模式下, 均能准确无误地还原衰减率, 对于测量噪声以及摄像机自动曝光调整具备良好的鲁棒性。在自由落体实验当中, EMMA连续时间的建模方式在本质上适应不规则采样, 然而对离散微分的依赖使其于帧率变化之际误差扩大。
第二类是对真实世界系统的多参数进行提取, 这同样构成了EMMA最具较高挑战性的呈现。具备差速驱动的遥控小车存在9个相关参数, 里其中, X臂长、Y臂长、还有轮半径、质量以及质心高度有所属的已明确知晓值得真值。质心高度和轮半径属于那种会隐藏起来的动力学参数, 也就是没办法从视频当中直接见到、观察到明确情况的, 而其余的参数则是能够清晰显现出来的参数。在有那已知真值的5个参数上面, EMMA的平均误差是8.8%±1.7%, 就比如, X臂长估算出来为0.196m, 而真实值呢是0.178m, 轮半径估算为0.223m, 真实值是0.201m, 质心高度估算为0.120m, 真实值为0.112m。关键在于, EMMA并未用上任何有关车轮空转功率或者坐标系原点的先验信息, 那些不变量全都是由系统自行学习校准的。
六自由度的那种四旋翼无人机, 存在着12个参数, 在这当中, EMMA于有着已知真值的7个参数之上, 其平均误差为15.9%, 并且误差范围是±7.4%。对于推力系数, 估算值为1.017 , 而真实值是1.1;对于扭矩系数, 估算值是1.501,真实值却为1.3;对于电机增益, 估算值为1.007 , 真实值是0.91;对于电机时间常数, 估算值乃0.015s , 真实值是0.012s;对于X臂长, 估算值为0.158m , 真实值是0.18m;对于Y臂长, 估算值是0.173m , 真实值为0.20m;对于Z轴偏移, 估算值为0.051m , 真实值是0.07m。其中, 推力系数属于隐式动力学参数, 扭矩系数属于隐式动力学参数, 电机增益属于隐式动力学参数, 时间常数属于隐式动力学参数, 这些均由音频推断的旋翼转速辅助估算, 视频数据提供的是位置轨迹。
第三类是去从仿真图表里提取参数, 这涵盖了F8战斗机飞行控制(有3个参数), Lotka - 捕食者 - 猎物生态模型(具备4个参数), 混沌振荡器(存在3个参数), HIV治疗动力学, 以及I型糖尿病自动胰岛素输送系统(最小模型,只有血糖这一个可测量状态变量, 其余的全都是隐式变量)。在所有的案例当中, EMMA在参数估算均方根误差(θrmse)方面, 以及在轨迹重建均方根误差(xrmse)方面, 都有着大幅度的优于情况。以Lotka - 为例, 在显式动力学, 也就是所有状态皆可观测这种条件之下, EMMA的θrmse是0.048±0.003且为0.054±0.013;而在隐式动力学, 即只有一个状态可观测此条件下, EMMA的θrmse为0.054±0.003, 高达6.3±1.7。混沌系统的轨迹重建误差具备更大差距呢: 在显式条件时, EMMA为1.68±0.4且为3.66±1.1;在隐式条件时, EMMA为1.7±0.4, 飙升到37.4±6.1。处于最为极端状况的糖尿病AID案例, 是在隐式条件之下, EMMA的轨迹误差表现为8.7±1.6, 而此误差的另一种状况则高达79.6±21.3。
**六、EMMA的"免疫测试"——鲁棒性验证与效率分析**
一套出色的推理系统, 不但要在理想状况下展现卓越表现, 而且要对各类干扰具备相当抵抗力, 研究团队特地开展了多项鲁棒性测试。
在初始化灵敏度测试之时, 团队把参数搜索范围扩充至真实值的百分之二百, 且从距离真实值较远的地方着手进行优化。其结果表明, EMMA在六个测试配置里的五个之上, 达成了低于百分之十的误差(举例来说, 低坡度滑块配置: 初始化从二十五度起始, 估算结果为二十点六九度, 真实值是二十度, 误差三点四五;一百五十厘米摆长配置: 初始化从一点一米开始, 估算结果为一点六二零米, 误差八点零二;九十厘米摆长配置是唯一超过百分之十的情形, 误差二十四点零八)。这意味着, EMMA并不 要"做出接近正确的猜测才能够趋于稳定", 它对于启动时给定的条件、配置的依赖比较微弱。
在针对音频噪声鲁棒性所开展的测试里, 团队朝着小车的音频流之中, 注入了具备不同信噪比的高斯噪声, 具体的信噪比分别为20dB、10dB、5dB。最终, 所得结果是, 与小车相关的所有估算参数的变化幅度, 全都低于1.1% , 这里面, X臂长所对应变化幅度为0.15% , Y臂长所对应变化幅度为0.55% , 轮半径所对应变化幅度为1.08% , 质心高度所对应变化幅度为0.04%。这充分表明, 音频处理流程对于现实环境当中出现的噪声干扰, 具备相当良好的抵抗性能。
进行多随机种子统计验证时, 针对小车, 在标号涵盖42到46的5个随机种子情形下, 其平均误差是9.5%±8.9%, 对于无人机而言, 该平均误差为17.5%, 此验证证实显示出结果具备可重现的特性是因并非只是偶然情况。
就计算效率而言, EMMA在RTX Ada 6000 GPU上每个训练周期平均花费时间为0.37秒, 这是对比方法(每个周期为时0.19秒)的 1.4倍。耗时有所提高是因为LTC网络需要去求解常微分方程这种计算密集型的操作。然而EMMA的模型参数量仅仅是53.2K, 而另一个为5.7M, EMMA的参数量是那个的一百零七分之一。这种设计是极度轻量化的, 这意味着EMMA在资源受限制的边缘设备上进行部署是天然适合的, 相关研究显露出类似架构在FPGA上能够达成11倍的内存降低。
七个方面, 从仅仅停留在理论层面的空谈, 转变为实际能够得以运用, 这样的转变过程之中, 关于EMMA的现实所具备的作用以及其存在的局限。
EMA被提取出的所有参数, 都是能够被解释, 且能够被执行的, 也就是说, 凭借这些参数能够直接驱动仿真器, 进而得到与真实系统高度相符的轨迹, 这同那些仅仅能够输出“黑盒”预测的纯数据驱动方法存在着本质的差异。一个精准的数字孪生所意味的是, 工程师能够于虚拟环境里面对自动驾驶车辆开展安全测试, 无需让真实车辆去冒风险;维修团队能够通过对比数字孪生的行为以及真实设备的行为来诊断故障;控制算法能够以准确的物理模型为基础来进行设计, 而非依靠不断地试错。
当然, EMMA目前也是有着明确的局限性的, 它依赖着至少一个会随时间改变的可观测模态, 完全的静态观测并不能为动态参数估算给出足够多的信息。在音频处理里的那些线性频率 - 转速先是, 在无人机飞行状态之下或者有种情况——这个情况处于存在很强空气动力学效应会让声音特性愈发复杂的状况下便是强湍流下或会出现效用失效的情况。系统对于剧烈的摄像机抖动是比较敏感的, 原因在于跟踪算法是依赖着帧间连续性发挥作用的。除此之外, LTC网络的ODE积分会致使运行时间比简单的静态神经网络要高一些。
实际上, EMMA之举能够被一句话讲述清楚, 呈现出这样的状况, 它使得随便一台普通到极致的相机, 以及任何一个再平常不过的麦克风, 甚至一篇陈旧论文当中的一张图表, 皆存在成为还原真实世界物理规律这么一种科学仪器的可能性。当机器能够达成“听音辨速”, 还能做到“观形知力”, 亦可达至“读图识参”之时, 构建高保真数字孪生的门槛就从“专业实验室”这种境地降低到了“有数据就行”这般程度。而这对于无人机、机器人、工业自动化、医疗监控以及太空探测这些领域的研究者来讲, 均意味着一条新鲜的捷径。怀有兴趣的读者能够借助arXiv编号2605.24047去查阅那完整的论文, 代码, 还有数据, 统统已凭借论文里所提供的仓库予以公开了。
Q&A
第一个问题: EMMA框架为何要一并运用视频、音频以及图表这三种数据,仅仅使用视频难道不可以吗?
甲方面称, 仅仅依靠视频存在着一个根本性的缺陷, 那便是诸多对于物体运动产生影响的关键因素根本就不会在画面当中出现, 像遥控小车的电机指令, 无人机的旋翼转速, 它们都属于“隐藏驱动力”, 视频是完全没办法看到的。音频能够对这一点起到弥补作用, 毕竟电机转速越快, 声音频率也就越高, 能够依据声音反向推断出转速。图表能够让系统能够从已有的仿真报告或者传感器显示图里直接提取数据, 扩大了数据来源的范围。三种模态相互补充, 才能够使完整的物理图景得以还原。
问题二: EMMA当中的“液态时间常数网络”, 与普通神经网络, 存在着怎样的实质方面的区别呢?
A: 普通循环神经网络处理时间序列是按照固定节奏的, 就如同那依照节拍行进的节拍器一样。液态时间常数网络的关键之处在于, 它所具有的 “记忆衰退速度” 也就是时间常数并不是固定不变的, 而是会伴随输入信号出现动态变化。由于存在这样的特性, 使得它能够对外部驱动力例如电机指令以及隐式物理-诸如摩擦力等开展自然而正常地建模。在那种存在外部驱动力的复杂场景当中实验表明, 它相较于 ODE平均误差要低大约25%, 相较于CT-GRU要低大约5%。
第三个问题: 由EMMA估算得出的物理参数, 其精度究竟能够达到怎样的一种水平, 与之对应的误差的大小又是多少呢?
在标准基准测试当中, EMMA针对150cm摆长进行估算时引起的误差大概是0.07%(1.501m相对1.500m), 针对托里切利排水系数而言它引起的误差基本在2%范围之内, 在真实情形下的遥控小车上边儿, 5个带可知真值的参数生成平均后的误差是8.8%±1.7%;来到无人机身上咯, 7个有确定得知真值的参数所产生掉平均差为15.9%±7.4%。误差的高低是按系的复杂度及可观测信息的丰富程度来决定的, 不过整体是处在工程应用能接受下去范围以内的。
