数据标注公司,正在抢一张具身智能的新船票!
2026-08-13 16:55 来源: 点击:205

互联网时代的数据是被发现的,具身智能时代的数据需要被制造。


过去十年,AI 数据产业最重要的生产资料,是“人”。

成千上万的数据标注员坐在电脑前,给图片画框、给语音转写、给文本分类。自动驾驶最火的时候,他们标车道线、红绿灯和障碍物;大模型爆发后,他们又开始做 RLHF、指令数据和模型评测。

但到了具身智能时代,数据生产的方式正在发生一次更彻底的变化

「人不再只是坐在电脑前“标数据”,而是开始真正进入物理世界“生产数据”。」

一个操作员戴着 VR 设备,远程控制机械臂拿起杯子、叠衣服、整理货架;机器人完成一次动作,背后同步产生相机视频、深度信息、机械臂关节角、末端执行器轨迹、夹爪状态甚至力觉数据


过去的数据工厂,是一排电脑。未来的数据工厂,可能是一排机器人。


这也是为什么,一批传统数据标注企业正在重新审视自己的下一站:从“数据标注”进入“具身智能数采”

表面看,这只是业务从 annotation 延伸到了 collection。

但真正的问题是:

「这是一次自然升级,还是一次跨行业冒险?」

本文看点

01

机器人数据需要被“制造”

02

把机器人实验室变成工业产线

03

从人力生意升级为基础设施



1、具身智能真正缺的,可能不是机器人,而是数据

过去两年,具身智能行业最热门的话题一直围绕“大脑”和“本体”

谁家的 VLA 模型更强,谁家的机器人更便宜,谁家的灵巧手自由度更多。

但随着机器人公司真正开始训练模型,一个越来越现实的问题浮出水面:

「机器人数据从哪里来?」

大语言模型可以吃互联网。机器人不行。

一个语言模型想学习“苹果是什么”,互联网上已经有几十亿张图片和文本。

但一个机器人想学会“把苹果从桌子上拿起来放进篮子”,需要的数据完全不同

模型不仅需要知道苹果长什么样,还需要知道:

1

手应该从什么方向接近;

2

机械臂每一帧应该移动多少;

3

什么时候闭合夹爪;

4

夹取失败以后如何恢复;

5

不同大小、材质、位置的苹果分别应该怎么操作。

这类数据不是天然存在于互联网里的。

它必须被“做”出来

这也是具身智能和上一代 AI 最大的区别之一。

「互联网时代的数据是被发现的,具身智能时代的大量数据则需要被制造。」

于是,一个新的产业开始出现:

机器人数据工厂

今天,一家机器人公司如果想训练一个泛化能力更强的 manipulation 模型,通常有几条路。

1

自建机器人团队和数据中心;

2

从真实用户机器人运行中积累数据;

3

通过仿真生成数据;

第四种,也是越来越重要的一条路径:

找外部公司帮助自己规模化采集真人示教数据。

这正好落在传统数据标注公司的能力半径附近。



2、数据标注公司最大的资产,不是标注员

很多人理解数据标注行业,第一反应是“廉价劳动力”

但这恰恰低估了这个行业。

一家能够长期服务自动驾驶和大模型客户的数据公司,真正积累的能力通常有四个


大规模人的组织能力

100 个人按照同一套 SOP 做同一件事并不难。1000 个人连续六个月,把错误率控制在一个很低的水平,这件事并不简单。


质量管理

AI 数据业务最核心的问题从来不是“能不能做”,而是:

「能不能稳定地做对。」

标注行业过去十年建立了一整套成熟的方法,包括任务拆分、培训、考试、抽检、复审、返工、golden set 和质量评分


数据工程能力

真正大型的数据项目,并不是把文件扔给标注员。数据要经历采集、清洗、切片、分发、处理、质检、版本管理、交付等完整生命周期


To B 项目交付能力

机器人公司需要的不只是操作员。它需要一个供应商告诉它:

一个月可以交付多少小时数据;有效率是多少;失败轨迹如何定义;传感器数据如何同步;数据格式如何交付;出现问题以后多快返工。

这些事情,恰恰是数据标注企业熟悉的语言

所以,从商业组织形态来看,传统数据标注公司其实是目前最接近“具身数据服务商”的一类企业。

只是过去管理的是电脑和标注员。

未来要管理的是机器人、操作员和真实物理场景



3、但机器人数据,不是“高级一点的数据标注”

这也是最容易踩坑的地方。

很多数据标注公司进入具身智能以后,会天然认为:

既然都是数据生意,那就把机器人买回来,再招一批操作员就可以了。

真正跑起来以后才会发现,完全不是一回事

传统数据标注的问题主要发生在软件世界

具身数据的问题,大量发生在物理世界

机械臂会撞。相机会漂。夹爪会坏。标定会失效。网络会掉线。

一台机器人可能上午还能正常工作,下午某个关节就开始异常

更麻烦的是,很多问题并不会让机器人彻底停止工作。

它仍然可以采集数据。

只是采出来的数据已经不能用了

比如 RGB 和深度相机时间没有对齐;机械臂关节状态出现丢帧;相机外参变化;动作轨迹记录频率不稳定。

在传统标注项目里,一个操作员做错一个 bounding box,返工即可。

但在具身数据项目里,如果机器人运行了三个小时才发现标定错误,意味着:

「这三个小时的数据可能全部报废。」

因此,具身数采真正考验的是一个新能力:

「把机器人实验室,变成工业化生产线。」

这也是未来数据公司的竞争壁垒所在。


4、第一批机会,不在“做一个机器人数据 Scale AI”

所有进入新行业的公司都有一个冲动:

一上来就想做平台

数据标注时代诞生过 Scale AI,因此很多创业者自然希望在机器人时代复制一个“Robot Scale AI”。

但对一家传统数据标注公司而言,更现实的路径可能恰恰相反。

💡 先不要做平台,先做产能。

原因很简单。

机器人行业现在最缺的不是一个新的数据管理 SaaS

而是:

“我下个月需要 5000 个小时的 manipulation data,你能不能交出来?”

因此,一个数据公司的第一阶段产品,最好不是平台,而是一项非常具体的服务:

机器人遥操作数据采集。

客户提供机器人和任务。数据公司提供场地、操作员、SOP、质检和数据交付

比如客户希望训练机器人整理桌面。数据公司需要在几十个不同桌面环境里,让操作员完成:

1

拿杯子;

2

移动瓶子;

3

整理餐具;

4

打开抽屉;

5

把垃圾放进垃圾桶。

每完成一次任务,就产生一条episode

模型真正需要的,可能不是 1000 条完美轨迹。

而是几十万条包含不同物体、不同光照、不同桌面、不同初始位置的数据

这恰好进入了传统数据公司的舒适区:

规模化复制。


5、最值得做的,不是“采数据”,而是“把采数据工业化”

未来具身数采产业真正可能产生利润的地方,不是单纯卖操作员小时

如果一家企业只做:

客户给 20 台机器人;企业派 40 个操作员;然后按人天收费。

那么它最终仍然会变成传统外包业务

价格竞争几乎不可避免。

真正应该建立的是一套“数据工厂能力”

比如一个 50 工位的数据中心,可以像工厂一样计算:

1

每台机器人每天运行多少小时;

2

每小时产生多少条 episode;

3

成功率是多少;

4

设备利用率是多少;

5

操作员熟练度是多少;异常率是多少;数据有效率是多少。

最终甚至可以算出:

💡 一条合格机器人轨迹的生产成本是多少。

当这个数字可以持续下降,规模效应才真正出现。

一个成熟的机器人数据工厂,本质上应该像富士康

客户给的是任务定义。工厂负责把任务拆解成可以规模复制的生产流程。

区别只是富士康生产的是手机。机器人数据工厂生产的是:

行为。



6、第一批客户,可能只有几十家

这是这个市场目前最大的现实。

数据标注行业曾经可以服务互联网、电商、金融、安防、地图、自动驾驶等大量行业。

但真正大规模采购机器人数据的客户,在今天仍然高度集中

1

机器人本体公司;

2

VLA 和机器人基础模型团队;

3

大型科技公司的机器人实验室;

4

希望开发行业机器人的企业。

这些客户数量可能不算多,但单个客户的数据需求可能非常大

原因是机器人训练存在一个非常残酷的规律:

「数据永远不嫌多。」

如果一家机器人公司发现,模型能力随着真实示教数据增加仍然持续提升,那么它的数据采购预算很可能迅速放大。

这会让具身数采呈现一种和自动驾驶数据非常类似的市场结构:

客户少。项目大。认证周期长。供应商一旦进入供应链,合作粘性很强。

因此,对于传统数据公司来说,第一个目标不是获取 100 个客户。而是:

拿下 3 个真正有模型训练能力的客户。



7、一个现实的入局方式:10 个人、4 台机器人、3 个月

如果今天是一家传统数据标注公司的老板,最危险的事情可能是:

先租一个 3000 平方米厂房。然后买 100 台机器人。再成立一个“具身智能事业部”。

更合理的方式,是做一个非常小的MVP

第一阶段甚至只需要:

1

4 台机械臂;

2

4 套遥操作设备;

3

8 个操作员;

4

1 个机器人/ROS 工程师;

5

1 个数据工程师。

总共大约 10 人。找一个 100—200 平方米的场地。场景也不用复杂。

桌面、货架、厨房台面

选择 20—30 个高频 manipulation task:

拿。放。移动。整理。开抽屉。关抽屉。倒水。折叠。装箱。

然后验证三个指标

第一:一天到底可以稳定采多少有效小时?

第二:数据有效率能不能稳定超过 90%?

第三:客户是否愿意持续购买?

如果这三个问题没有跑通,就不要扩张。

因为具身数据真正的商业模式,从来不是卖机器人。而是:

设备利用率 × 人员利用率 × 数据有效率。



8、真正的壁垒,会从“人力池”变成“任务库”

数据标注公司过去最喜欢讲一个指标:

有多少标注员

10 万人。20 万人。覆盖多少城市。

但到了机器人时代,这个数字的重要性会下降

因为机器人操作员是可以快速培训的。

真正有价值的是企业积累了多少:

task template;scene template;failure case;operation policy;quality rule。

举个例子。“把杯子放进洗碗机”看起来只是一个简单任务。但工业化以后,会拆成大量变量

杯子材质。杯子大小。杯子位置。洗碗机高度。门打开的角度。环境光照。左右手。抓取姿态。失败恢复方式。

这些变量组合以后,本质上就是一个巨大的任务空间

因此,未来优秀的数据公司可能会建立一个“机器人任务库”。

客户说:我要训练家庭机器人。数据公司不是从零开始设计采集方案。而是直接调用:

Kitchen Pack。包含 300 种场景、2000 个任务组合和对应的质检规则。

这时,公司卖的就不再是“操作员”。而是:

「数据生产能力。」



9、再往后一步,是从数据外包走向数据资产

具身智能数据行业最终可能出现三个阶段

1

第一阶段:人力服务。客户给机器人,供应商提供操作员。

2

第二阶段:数据工厂。供应商自己建设机器人产线,根据客户需求规模化生产数据。

3

第三阶段:数据资产。供应商提前生产标准化数据,然后授权给多个模型公司使用。

第三阶段一旦成立,商业模式就会发生巨大变化

因为服务业务卖一次赚一次。数据资产可以卖很多次。

比如一家数据公司积累了 100 万条家庭场景 manipulation episode。其中包括厨房、卧室、客厅、货架、仓储等大量任务。

如果这些数据足够标准化,它未来可能会像今天的图像数据集一样,成为机器人基础模型的训练资产

那时,这家公司就不再是一家传统意义上的外包公司。而更接近:

「机器人时代的数据基础设施公司。」



10、真正的机会窗口,可能只有两三年

具身智能数据服务现在最大的机会,恰恰来自一个短暂的不平衡

模型公司的数据需求增长速度,大概率会快于自己的数据基础设施建设速度。

早期机器人创业公司最重要的任务是:

做机器人。训模型。找融资。拿订单。

它们不一定愿意同时管理几百个操作员、几十个场景和上百台设备。

于是第三方数据公司获得了窗口期

但这个窗口不会永远存在。

当一家头部机器人公司的数据需求达到足够大规模以后,它一定会考虑自建

因此,第三方数据公司必须在客户自建之前建立一个足够强的理由:

「为什么外包给你,比自己做更便宜、更快、更稳定。」

这个答案不应该是:“因为我们人工便宜。”而应该是:

1

同样 100 台机器人,你的数据有效率比客户高;

2

设备利用率比客户高;

3

操作员培训速度更快;

4

新任务上线时间更短;

5

失败数据管理更成熟。

最终让客户发现:自己建一个数据中心,需要管理机器人、场地、招聘、培训、设备维护和质量体系。

而找你,只需要提出一个需求:

「给我 10 万条高质量轨迹。」



11、AI 数据产业,正在从电脑桌走向真实世界

过去十年,数据标注行业经历过两次巨大的机会

一次是计算机视觉。一次是大模型。

很多公司抓住过第一个周期,却错过了第二个。

现在第三个周期正在出现。

只是这一次,数据不再只存在于硬盘里。它发生在真实世界。发生在机械臂拿起杯子的那一秒。发生在机器人推开抽屉的一瞬间。发生在人类把自己的动作,通过遥操作设备传给机器人的过程中。

对于传统数据标注公司来说,具身智能最大的机会,并不是把“数据标注”四个字换成“具身智能”。而是完成一次更彻底的能力迁移

「从管理数据的人,变成管理数据生产线的人。」

未来几年,这个行业或许会诞生一种新的公司。

它没有最先进的机器人。也没有最大的基础模型。但它拥有几千台持续运行的机器人、数万个真实场景,以及每天稳定生产数百万条行为轨迹的能力。

如果说大模型时代最重要的基础设施之一是 GPU 集群。那么在具身智能时代,另一种基础设施可能正在形成:

「机器人数据工厂。」

💡 而这,或许正是传统数据标注企业最后一次把“人力生意”,升级成“基础设施生意”的机会。


培训咨询热线: 

北京中心:010-58612706 

成都中心:028-67835378





参与评论