具身智能卖铲人:数据标注与采集半年融资170亿背后的技术逻辑
具身智能这条赛道,现在最赚钱的可能不是做机器人的,而是给机器人“喂饭”的。
半年时间,这个群体融了超过 170 亿元人民币。这不是整车厂的故事,也不是大模型公司的故事,而是数据标注与采集公司的故事。业内把这类角色叫“卖铲人”——别人淘金,他们卖铲子。具身智能的铲子,就是数据。
这篇文章不聊“具身智能多伟大”这种宏观叙事,直接拆三件事:数据为什么成了具身赛道的硬通货,数据生意的技术门槛到底在哪,以及作为技术开发者和创业者,怎么接住这波数据红利。
1. 半年 170 亿:数据标注公司凭什么成为资本焦点
先说一组能看到的行业事实。
2025 年上半年,具身智能领域的数据采集、标注、合成相关公司融资节奏明显加快。综合公开披露信息,围绕“具身智能数据”这一环节的融资规模累计已超过 170 亿元人民币。这个数字放在整个人工智能融资大盘里也很突出。
为什么资本突然盯上数据生意?核心逻辑只有一个:数据缺口已经超过算力缺口,成为具身智能落地的主要瓶颈。
大模型时代,文本数据几乎被互联网存量吃干榨尽,各大厂开始用合成数据续命。但具身智能不一样,机器人需要的是物理世界的交互数据——机械臂怎么抓杯子、双足机器人怎么上下楼梯、服务机器人怎么避开障碍物。这类数据互联网上没有,必须要到真实世界去采,或者用工程手段合成。
而采集真实物理数据又慢又贵。一个熟练的遥操员一天可能只能采集几十条有效轨迹;一条高质量的“抓取—移动—放置”数据,从硬件调试到人工标注,成本可能达到几十元甚至上百元。对比之下,CV 时代的一张图片标注只要几毛钱。
数据标注行业,等于从“劳动密集型”直接跳到了“高技术密度 + 重资产”阶段。
2. 具身数据生意的三个技术环节:采集、标注、合成
从技术开发者的视角看,具身智能数据不是“拍视频 + 框物体”这么简单。它是一条完整的流水线,拆开看有三个核心环节,每个环节都有对应的工具链和岗位需求。
2.1 数据采集:遥操作、自动采集、多模态对齐
具身智能训练数据的采集方式,目前主流有三类。
第一类是人工遥操作采集。操作员通过 VR 设备、主从机械臂或示教器,远程控制机器人完成动作,同时记录关节角度、力矩、视觉图像、语音指令等多维数据。这种方式数据质量高,但成本也最高。
第二类是自动化采集。在固定工位上布置多台相机,让机器人反复执行同一任务,利用视觉算法自动切分有效片段。这种方法适合数据量要求大、动作相对固定的场景,例如分拣、码垛。
第三类是异构机器人数据复用。同一个操作轨迹,通过运动学映射迁移到不同构型的机器人上。这条路径对算法要求高,但能显著摊薄单台设备的采集成本。
技术上的关键点在于多模态对齐:视觉流、关节角度流、力觉流和语言指令需要精确到毫秒级同步。很多团队初期只关注图像质量,忽略了关节角度的采样频率,结果训练出来的策略一上真机就“手抖”。这属于典型的数据采集环节经验坑。
如果你的团队要自建数据采集流水线,优先检查三个指标:
| 指标 | 建议基线 | 说明 |
|---|---|---|
| 关节角度采样频率 | 不低于 100Hz | 低于 30Hz 会导致动作轨迹失真 |
| 视觉与关节数据时间差 | 小于 10ms | 超过 50ms,策略学习会出现明显偏差 |
| 单条数据有效长度 | 3s 到 30s | 过短无法学习完整动作,过长引入冗余噪声 |
2.2 数据标注:从 2D 框选到 3D 语义理解
传统 CV 标注用矩形框、多边形、关键点就能交差。具身智能数据的标注维度复杂得多,至少包括五层:
- 2D 视觉标注:目标检测、分割、追踪,这是基础层。
- 3D 空间标注:点云分割、三维包围盒、物体位姿估计。
- 动作语义标注:把连续的动作流切成原子动作,例如“伸手”“抓取”“移动”“释放”。
- 任务级标注:标注整个任务的目标、约束条件和成功标准。
- 语言对齐标注:把自然语言指令和对应的视觉、动作片段关联起来。
当前行业里最缺的是第 3 层和第 5 层标注能力。原因很直接:这两层既需要理解机器人运动学,又需要理解自然语言意图,普通标注员经过短期培训很难达标。
这种复合型标注团队的搭建,本身就是数据公司的核心壁垒。资本看好的不是“人多”,而是“懂机器人又懂标注”的团队密度。
如果你在做相关项目,这里有一个实操建议:优先用半自动标注工具分流 70% 的简单工作量,把人力集中在动作语义和语言对齐这两个高价值环节。比如先用预训练模型生成 2D 检测框和 3D 点云伪标签,再让标注员修正,效率能提升 3 到 5 倍。
2.3 数据合成:仿真引擎与真实数据混合训练
真实数据太贵、太难采,行业自然走向仿真合成。具身智能中常用的合成方案包括:
- 物理仿真引擎:如 MuJoCo、Isaac Sim、Genesis,在虚拟环境中大规模生成交互数据。
- 随机域泛化:随机化纹理、光照、物体形状,让策略学到任务本质而非场景特征。
- 扩散模型生成数据:利用大模型生成物体的多视角图像,再投影到三维空间。
- 大语言模型驱动的任务生成:用 LLM 自动生成任务描述和指令,再驱动仿真环境自动执行。
仿真数据的问题也很明显:Sim-to-Real Gap(仿真到真实迁移差距)。在仿真里学得再好,一到真实世界就“水土不服”。当前工程界的通行做法是混合训练——真实数据做底,仿真数据做量,比例大概从 1:1 到 1:10 不等,具体要看任务复杂度和真机验证反馈。
这里要泼一盆冷水:合成数据不是“免费午餐”。它只是把采集成本从硬件侧转移到了算法侧。如果团队没有足够的真实数据作为锚点,大量合成数据反而会引入系统性偏差。
3. 端到端模型时代,数据成了新的军备竞赛
目前具身智能模型的主流技术路线,已经从“感知 + 规划 + 控制”的分层架构,逐步转向端到端模型,其中最典型的是 VLA(Vision-Language-Action,视觉语言动作)模型。
VLA 模型的训练逻辑和 LLM 高度相似:给它海量的“视觉输入 + 语言指令 + 动作输出”三元组数据,让它学会直接输出动作。问题在于,LLM 的训练数据是互联网海量文本,而 VLA 的训练数据还没有形成规模效应。
这也是为什么科技巨头和头部创业公司都在疯狂囤数据。
从数据规模看,行业头部玩家已经展示出明显的“数据飞轮”效应:
| 数据规模 | 策略表现 | 参考场景 |
|---|---|---|
| 千条级 | 单一场景、固定物体可完成,泛化差 | 实验演示 |
| 万条级 | 同一场景多物体可完成,仍受场景限制 | 初步试产 |
| 十万条级 | 跨场景泛化明显,初步具备通用操作能力 | 规模化测试 |
| 百万条级 | 接近通用操作,可处理长时序复杂任务 | 商业探索 |
上面这个表格是从多份公开技术报告中归纳的相对量级,不是某个具体模型的官方参数。但它反映了一个趋势:具身智能模型的智能水平,直接受数据规模驱动。谁的数据管线更高效,谁的模型迭代就更快,谁就能拿到下一轮融资。
这就是数据公司“暴利”的本质——它们不是靠卖一次数据赚钱,而是靠持续构建别人无法轻易复制的高质量数据管线。
4. 数据采集和标注企业的核心壁垒不是数据本身
仔细看这轮融资中跑出来的公司,会发现它们的共同点不是“数据量大”,而是**“数据闭环能力强”**。
数据闭环指什么?简单说就是四个环节循环起来:
- 在真实或仿真环境中采集数据。
- 清洗、标注、增强、格式化。
- 输入模型训练,在真机上评测。
- 把失败案例返回数据管线,补充标注和采集。
闭环能力的核心是工程效率。同样训练一个“拿起水杯”的任务,A 公司可能需要 3 万条数据、6 周时间;B 公司通过数据增强和仿真优先策略,可能只用 8000 条数据、2 周时间就达到同等效果。差距不在模型结构,而在数据管线的工程调度能力。
对于想入局的技术团队,这里有几个可执行的方向:
4.1 面向中小机器人团队的“数据工具链”外包服务
很多机器人创业团队有硬件能力、有算法能力,但数据基础设施一塌糊涂。你可以提供标准化的采集 SDK、标注平台、数据格式转换工具,按项目收费或做 SaaS 订阅。这是典型的“卖铲子”生意。
工具链应该包括:
- 多传感器同步采集 SDK(相机、IMU、关节编码器)。
- 数据可视化回放工具(同时显示视频和关节角度曲线)。
- 标注任务分发与质检后台。
- 模型训练结果反馈接口,形成闭环。
4.2 垂直场景数据集建设
与其做大而全的通用具身数据,不如在细分场景深挖。比如:
- 零售货架拣选数据集。
- 医疗陪护机器人交互数据集。
- 物流分拣场景的包裹操作数据集。
- 餐饮场景的餐具抓取与摆放数据集。
垂直数据集的商业价值是很明确的:机器人公司落地时都需要场景化数据冷启动,它们往往没有时间和成本自己去采集,采购垂直数据集比自建便宜得多。
4.3 数据合成与增强工具平台
如果你熟悉仿真引擎和生成式 AI,可以做一个面向具身智能的数据合成平台:用户上传 3D 物体模型,平台自动生成带标注的全场景仿真数据。这类平台有两条路可以走,一是做通用平台,二是和仿真引擎厂商深度绑定,做垂直集成。
5. 数据清洗与数据增强:具身数据治理的工程实践
上一部分讲了商业机会,这部分落到具体工程师的日常:拿到一批原始具身数据后,怎么处理才能用于模型训练?
具身数据的原始形态通常是一堆文件夹,包含图像序列、深度图、关节角度 JSON、语音指令等。直接丢给模型训练大概率效果很差,必须经过清洗和增强。
5.1 数据清洗四步走
第一步:时间戳对齐。检查图像帧和关节角度的时间戳,偏差超过阈值则丢弃或用插值修补。这一步最常见的坑:相机缓存导致图像流延迟,做完对齐后发现动作提前于画面。
import numpy as np def align_timestamps(image_timestamps, joint_timestamps, joint_data, max_diff_ms=10): aligned = [] for idx, img_ts in enumerate(image_timestamps): # 找到最近的关节数据帧 diff = np.abs(joint_timestamps - img_ts) nearest_idx = np.argmin(diff) if diff[nearest_idx] <= max_diff_ms: aligned.append((idx, nearest_idx, joint_data[nearest_idx])) # 偏差过大则丢弃该图像帧 return aligned第二步:质量筛选。图像模糊、遮挡过重、机器人执行失败的数据直接过滤。这里建议用 CLIP 或自监督模型做嵌入相似度筛选,人工只复核边界样本。
第三步:任务切片。把连续数据流切分成“单次尝试”样本。判断依据通常是执行器状态变化、任务完成信号的跳变,以及动作序列的停顿点。
第四步:格式标准化。统一图像分辨率、归一化关节角度范围、统一语言指令模板。格式不统一会在训练时引入大量隐性噪声。
5.2 数据增强的具身版本
传统 CV 的数据增强(随机裁剪、翻转、色彩抖动)在具身数据上基本不够用。具身场景更有效的增强方式包括:
- 视角扰动:随机平移/旋转相机位姿,模拟相机安装误差。
- 动力学参数扰动:修改仿真中的摩擦力、质量、电机力矩系数,生成对抗性样本。
- 语言改写增强:用 LLM 把同一条指令改写成多种自然表达。
- 时序裁剪与拼接:从长轨迹中随机裁剪不同长度的片段,同时改变任务起始状态。
def augment_language_instruction(instruction): """利用 LLM 生成语义一致但表达多样的指令""" prompt = f"""请将下列机器人操作指令改写为 5 种不同的自然语言表达, 要求语义完全一致,句式多样,适合用于具身智能模型训练。指令原文:{instruction}""" # 这里对接企业内部的 LLM API return response这层增强做得好,可以用更少的真实采集成倍数扩大有效数据量。从公开案例看,做得好的团队,数据增强带来的效果提升甚至超过增大模型参数量。
6. 具身智能数据赛道的争议与风险
说回“暴利”这个词。任何一个高速增长的赛道,都会有泡沫和争议。具身数据生意至少有四个风险需要冷静看待。
6.1 数据价值难以标准化定价
同样是“拿起杯子”的数据,A 公司采集的能用,B 公司采集的不能用,但定价上可能看起来差不多。具身数据目前缺乏统一的评测基准和验收标准,买方很容易踩坑。这也意味着数据公司在商业化过程中,需要花大力气做效果展示和信任建设。
6.2 仿真数据“内卷”严重
仿真采集的门槛正在快速降低,开源仿真平台越来越多。如果只是做通用仿真数据,差异化空间很小。真正的壁垒还是在于“仿真数据 + 真实数据混合训练”的工程经验,而不是仿真本身。
6.3 单一客户依赖风险
具身数据公司的下游客户高度集中,可能就几家头部机器人企业和科技大厂。一旦大客户自建数据团队或转向内部闭环,数据公司的营收会剧烈波动。资本看重“数据闭环能力”,本质是在赌数据公司能持续绑定客户的长线价值。
6.4 隐私与安全合规
具身数据采集通常发生在真实物理空间,可能涉及人脸、家庭环境、商业场所等敏感信息。尤其是家用服务机器人、医疗陪护机器人场景,数据采集必须获得明确授权,必须做人脸打码、位置模糊等脱敏处理。
从合规角度看,以下动作是底线:
- 采集前获得场景负责人和涉及个人的书面授权。
- 数据存储和传输使用加密方案,限定访问权限。
- 涉及人脸、车牌等敏感信息,在进入训练流程前完成脱敏。
- 数据导出、共享、商用前进行法律复核。
这些不是可有可无的流程,在当前监管环境下,数据合规问题可以直接决定一个项目能不能继续推进。
7. 普通开发者如何参与具身数据浪潮
如果你不想创业,也不想加入数据公司,作为算法工程师或后端工程师,同样有非常具体的切入路径。
7.1 优先掌握数据工具链
具身数据领域最缺的不是算法科学家,而是能把数据管线跑通的人。建议优先熟悉以下工具链:
- 仿真数据生成:MuJoCo、Isaac Sim、Genesis 至少精通一个。
- 数据标注平台:熟悉 Label Studio、CVAT,了解 3D 点云标注插件。
- 多模态数据格式:熟悉 ROS2 bag、HDF5、JSON Lines、WebDataset 等格式。
- 模型评测:掌握在真实机器人或仿真环境中跑评测的流程。
7.2 关注开源数据集和模型
目前已经有不少机构开源了具身智能数据集,包括抓取、操作、导航等任务类型。初学者可以先用这些开源数据跑通训练流程,再考虑自建数据。
实操路线建议:
- 下载一个中等规模的开源操作数据集。
- 完成数据可视化、清洗、切片。
- 用开源的 VLA 模型做微调训练。
- 在仿真环境中部署评测。
这个流程走完,你对“数据管线对模型效果的影响”会有明显感知。
7.3 把数据能力做进简历
从技术招聘的角度看,有真实数据管线经验的候选人非常稀缺。如果你能在简历里写清楚:
- 处理过哪些类型的具身数据。
- 数据清洗和增强的工程方法。
- 数据规模对模型效果的影响分析。
- 踩过哪些数据坑、如何解决。
会比单纯写“熟悉 PyTorch”有竞争力得多。
8. 具身数据“卖铲人”生意的下一步
回到开头的 170 亿融资。资本在这个时间点重金押注数据公司,说明行业已经形成共识:具身智能赛道的瓶颈从模型结构转向了数据供给。
接下来值得关注的方向有三个:
8.1 数据标准化
目前具身数据领域还没有像 COCO、ImageNet 那样的公认基准数据集。谁能牵头建立具身数据的统一格式、标注规范和评测标准,谁就能占据产业链的制高点。
8.2 真机数据工厂
高端数据采集设备和专业采集团队的规模化运作,正在成为一种重资产商业模式。这种“机器人数据工厂”的建设需要大量硬件投入、人力管理和自动化软件支持,壁垒比单纯的标注公司高一个量级。
8.3 数据飞轮生态
未来更健康的模式可能是:机器人厂商在真实运行中持续回传脱敏数据,数据公司负责清洗增强,再反过来训练更好的模型给机器人厂商。这种数据飞轮一旦建立,就形成了商业上的强绑定关系。
这就是“卖铲人”真正值钱的地方——它们不只是卖数据,而是在搭建数据再生产的闭环系统。只要具身智能没有实现完全的小样本学习,这个闭环就会持续运转下去。
对技术开发者来说,现在入场还有窗口期。建议从数据工具链入手,不管你是做仿真、标注平台、数据清洗还是评测系统,需求都在持续放大。先把自己的“铲子”磨利,比什么都实在。
