正在阅读:

宝妈、外卖小哥戴上头盔为机器人“生产数据”

扫一扫下载界面新闻APP

宝妈、外卖小哥戴上头盔为机器人“生产数据”

众包模式入局,接棒具身数据下半场。

文| IT时报 沈毅斌

编辑|郝俊慧 孙妍

在具身智能兴起的几年间,大量具身智能数据采集中心拔地而起,人形机器人在其中反复练习行走、抓取,获取最基础的场景训练数据。但今年下半年,业界对数采中心的热情开始降温。

坐落于北京首钢园的北京首家人形机器人数据训练中心近期停运,原运营方睿尔曼智能撤出全部自有设备与机器人,成为数采中心第一轮洗牌的缩影。

与此同时,觅蜂科技发布觅蜂派App,以众包模式扩大数据采集网络。在杭州、苏州等数十个城市,许多普通人开始戴上轻量化头戴设备,把做家务、理货、做手工的日常过程记录成数据。不用懂算法,不用进实验室,只要按任务要求完成操作,就能按有效时长获得报酬——分散在千家万户的真实场景,正在成为具身智能数据新的供给源。

一边是集中式数采厂的关停潮,一边是全民众包的新生路,具身智能的数据采集赛道,正经历商业模式的深层重构。

数采中心泡沫破裂

2025年,具身智能从概念快速走向落地,真机交互数据、第一视角动作数据的需求集中爆发,使得集中式数采中心成为最先跑通的商业模式,不少地方产业园甚至将数采基地作为招商标配,“建数采厂”一度成为赛道风口。

调研机构Interact Analysis报告显示,截至2026年4月底,国内已有至少90个人形机器人数据采集和训练中心处于使用或规划建设中;中国信通院人工智能所发布《具身智能训练场研究报告(2026年)》也显示,截至2026年6月底,全国建成启用超70家训练场,在建或规划中的训练场46家。

租下一片场地,搭出家居、仓储、分拣等模拟场景,采购一批机器人本体或动捕设备,雇用专职操作员做动作示范,采集完成的数据打包卖给模型厂商。这套标准化的复制路径,让“月产千小时数据”的故事在行业里反复上演。

场景建得多,但真正能让具身智能落地的应用数据却极其稀缺。

近日,被称为“具身智能眼脑手第一股”的企业梅卡曼德,其创始人兼CEO邵天兰在朋友圈发文表示,行业里有很多“攒局型”具身智能企业,利用所谓“数采中心”和与投资方、供应商的关联交易来制造虚假的、不可持续的收入。

此番言论刺破了数采中心的泡沫,也让业内开始重新审视这种重资产模式的合理性。而数采中心集中式采集模式的困境,本质上是三重天生短板的集中暴露。

首先是成本刚性难题。一座标准的真机数采中心,仅机器人本体、动捕设备、场地装修的前期投入就达数百万元,再加上人员薪酬、设备折旧、运维损耗,单小时数据的采集成本长期居高不下。更关键的是产能几乎没有规模效应,要提升数据产量,必须等比例增加机器人、场地和操作人员,投入和产出基本呈线性关系,很难通过扩张来摊薄成本。

其次是场景同质化困局。绝大多数数采厂的模拟场景都集中在叠衣服、搬箱子、包裹分拣等少数通用任务中,数据重复度极高。“很多单个模型和具身智能公司都在使用百万级小时数据,但类似叠衣服的数据已经泛滥,不需要了。”觅蜂科技CEO姚卯青在接受《IT时报》等媒体采访时直言,真正稀缺的精密装配、非遗技艺、特殊工况等细分场景,要么搭建成本极高,要么根本无法在封闭的模拟场地里复刻。

最后是质量参差不齐。行业仍处于野蛮生长阶段,不少团队用手机、运动相机凑数,帧率不达标、空间精度差、时间同步错位等问题普遍存在。随着头部模型厂商对数据要求提升,这类“水货数据”迅速失去市场。“年初大家还广撒网试各家数据,现在头部客户都开始定点独家采购,数据杂了反而会‘毒’模型。”姚卯青说。

当然,集中式数采并非就此失去价值。针对特定机器人本体的后训练数据、高精度真机遥操作数据,依然需要通过专业数采中心完成。只是这一市场容量有限,且已被头部玩家瓜分,大批跟风入局的中小玩家,自然成为泡沫破裂后最先出清的部分。

人人都能成为机器人“训练师”

集中采集模式难走通,行业开始向分布式要答案。Figure公布的Helix 2.5实验证明了众包模式的价值:在30套陌生住宅中,不采数据、不额外训练,Index的预训练让零样本成功率从9%提升至56%。

觅蜂打造的众包模式同样如此,让数据生产从“专人专职的成本项”变成“顺路产出的增量项”。宝妈做家务、餐厅服务员备餐、产线工人装配零件,动作本身就在日常生活中发生,采集只是额外增加一个记录环节,就能在原本8小时的工作时间里,产出5到6小时的有效数据,采集成本压缩到集中式采集的几分之一,甚至更低。

接单方式和外卖、网约车的众包逻辑异曲同工,平台方统一发布采集任务,大众通过觅蜂派App申领设备,在自身生活或工作场景中完成指定动作,数据经平台校验处理后交付客户,采集者按有效时长获取报酬。

《IT时报》记者在觅蜂派App上观察到,平台目前覆盖了22大类场景、5000多项任务,包括车间生产、商超理货、农业生产、医疗护理,甚至非遗技艺、体育运动等技能,也能成为训练机器人的数据来源。每次工作时长和报酬因内容不同有所区别,大致为2分钟到90分钟不等,价格从6元到30元不等。

其中最受欢迎的是居住类场景,包括物品收纳、家居清扫、厨房整理等。这类场景贴近普通人的日常生活,采集门槛极低,任务完成自由度高,大部分名额已经被抢空。

42岁的网约车运营人员李国英是较早一批参与数据采集的众包用户。结束白天的跑车工作后,他回到家就会戴上平台提供的MEgo数采设备,记录浇花、擦玻璃、整理桌面和文件的过程。大约15分钟后,他将数据上传至觅蜂派App,通过审核后获得任务收益。

众包模式的两道必答题

在数据如何被使用、最终服务于谁的问题上,Figure的Index与觅蜂派的方向各不相同。Index主要围绕Figure自身的模型训练需求建立数据闭环;觅蜂派则面向不同模型厂商、机器人企业和数据采购方,根据客户训练需求组织数据生产,将处理后的数据作为产品与服务对外交付。

能否跑通这套商业模式,觅蜂需要回答两个问题:一是谁会买数据、用数据?姚卯青将目标客群归纳为三类。第一类是具身智能企业,需要大批量的无本体众包数据用于基座预训练,帮模型建立通用的动作表征与环境感知能力;也需要对应本体的真机数据开展场景后训练,定向优化特定任务的成功率;第二类是世界模型创业公司,高度依赖第一视角的真实交互数据学习物理规律、动作逻辑与空间表征;第三类是头部大模型厂商。“大模型企业要进一步提升模型本身的智能能力,必须要进入真实世界去闭环、去决策这些数据。”姚卯青说。

据了解,觅蜂百万小时级无本体数据已开始服务腾讯Robotics X实验室、蚂蚁灵波等头部客户,根据不同模型训练需求提供相应的数据产品与服务。

另一个问题是,众包模式能够快速扩大产能,但分散在全国各地的采集者,如何保证数据输出质量?

觅蜂给出的方法是“硬件统一打底+自动化质检为主+分级价值复用”的全链路管控。所有众包人员使用MEgo系列采集设备,从硬件端就拉平采集标准;其次,端侧设备做基础合规校验,云端引擎自动完成画面切片、动作识别、隐私脱敏和质量打分,再辅以人工抽检。同时,按质量打上分级标签,匹配预训练、微调等不同阶段的模型需求。最终通过结算环节的数据,超过95%能进入模型训练环节。

从全球范围看,Figure的Index平台、国内的觅蜂派等玩家,都在验证众包数采的可行性,但赛道远未到终局,数据确权、定价标准、安全合规等行业共性规则仍待建立,从百万小时到亿小时的规模跨越,还需要更多模式创新。

可以确定的是,具身智能的数据供给,已经告别“一拥而上建工厂”的野蛮生长阶段,正在走向分工更清晰、模式更多元的成熟期。

排版/ 季嘉颖

本文为转载内容,授权事宜请联系原著作权人。

评论

暂无评论哦,快来评价一下吧!

下载界面新闻

微信公众号

微博

宝妈、外卖小哥戴上头盔为机器人“生产数据”

众包模式入局,接棒具身数据下半场。

文| IT时报 沈毅斌

编辑|郝俊慧 孙妍

在具身智能兴起的几年间,大量具身智能数据采集中心拔地而起,人形机器人在其中反复练习行走、抓取,获取最基础的场景训练数据。但今年下半年,业界对数采中心的热情开始降温。

坐落于北京首钢园的北京首家人形机器人数据训练中心近期停运,原运营方睿尔曼智能撤出全部自有设备与机器人,成为数采中心第一轮洗牌的缩影。

与此同时,觅蜂科技发布觅蜂派App,以众包模式扩大数据采集网络。在杭州、苏州等数十个城市,许多普通人开始戴上轻量化头戴设备,把做家务、理货、做手工的日常过程记录成数据。不用懂算法,不用进实验室,只要按任务要求完成操作,就能按有效时长获得报酬——分散在千家万户的真实场景,正在成为具身智能数据新的供给源。

一边是集中式数采厂的关停潮,一边是全民众包的新生路,具身智能的数据采集赛道,正经历商业模式的深层重构。

数采中心泡沫破裂

2025年,具身智能从概念快速走向落地,真机交互数据、第一视角动作数据的需求集中爆发,使得集中式数采中心成为最先跑通的商业模式,不少地方产业园甚至将数采基地作为招商标配,“建数采厂”一度成为赛道风口。

调研机构Interact Analysis报告显示,截至2026年4月底,国内已有至少90个人形机器人数据采集和训练中心处于使用或规划建设中;中国信通院人工智能所发布《具身智能训练场研究报告(2026年)》也显示,截至2026年6月底,全国建成启用超70家训练场,在建或规划中的训练场46家。

租下一片场地,搭出家居、仓储、分拣等模拟场景,采购一批机器人本体或动捕设备,雇用专职操作员做动作示范,采集完成的数据打包卖给模型厂商。这套标准化的复制路径,让“月产千小时数据”的故事在行业里反复上演。

场景建得多,但真正能让具身智能落地的应用数据却极其稀缺。

近日,被称为“具身智能眼脑手第一股”的企业梅卡曼德,其创始人兼CEO邵天兰在朋友圈发文表示,行业里有很多“攒局型”具身智能企业,利用所谓“数采中心”和与投资方、供应商的关联交易来制造虚假的、不可持续的收入。

此番言论刺破了数采中心的泡沫,也让业内开始重新审视这种重资产模式的合理性。而数采中心集中式采集模式的困境,本质上是三重天生短板的集中暴露。

首先是成本刚性难题。一座标准的真机数采中心,仅机器人本体、动捕设备、场地装修的前期投入就达数百万元,再加上人员薪酬、设备折旧、运维损耗,单小时数据的采集成本长期居高不下。更关键的是产能几乎没有规模效应,要提升数据产量,必须等比例增加机器人、场地和操作人员,投入和产出基本呈线性关系,很难通过扩张来摊薄成本。

其次是场景同质化困局。绝大多数数采厂的模拟场景都集中在叠衣服、搬箱子、包裹分拣等少数通用任务中,数据重复度极高。“很多单个模型和具身智能公司都在使用百万级小时数据,但类似叠衣服的数据已经泛滥,不需要了。”觅蜂科技CEO姚卯青在接受《IT时报》等媒体采访时直言,真正稀缺的精密装配、非遗技艺、特殊工况等细分场景,要么搭建成本极高,要么根本无法在封闭的模拟场地里复刻。

最后是质量参差不齐。行业仍处于野蛮生长阶段,不少团队用手机、运动相机凑数,帧率不达标、空间精度差、时间同步错位等问题普遍存在。随着头部模型厂商对数据要求提升,这类“水货数据”迅速失去市场。“年初大家还广撒网试各家数据,现在头部客户都开始定点独家采购,数据杂了反而会‘毒’模型。”姚卯青说。

当然,集中式数采并非就此失去价值。针对特定机器人本体的后训练数据、高精度真机遥操作数据,依然需要通过专业数采中心完成。只是这一市场容量有限,且已被头部玩家瓜分,大批跟风入局的中小玩家,自然成为泡沫破裂后最先出清的部分。

人人都能成为机器人“训练师”

集中采集模式难走通,行业开始向分布式要答案。Figure公布的Helix 2.5实验证明了众包模式的价值:在30套陌生住宅中,不采数据、不额外训练,Index的预训练让零样本成功率从9%提升至56%。

觅蜂打造的众包模式同样如此,让数据生产从“专人专职的成本项”变成“顺路产出的增量项”。宝妈做家务、餐厅服务员备餐、产线工人装配零件,动作本身就在日常生活中发生,采集只是额外增加一个记录环节,就能在原本8小时的工作时间里,产出5到6小时的有效数据,采集成本压缩到集中式采集的几分之一,甚至更低。

接单方式和外卖、网约车的众包逻辑异曲同工,平台方统一发布采集任务,大众通过觅蜂派App申领设备,在自身生活或工作场景中完成指定动作,数据经平台校验处理后交付客户,采集者按有效时长获取报酬。

《IT时报》记者在觅蜂派App上观察到,平台目前覆盖了22大类场景、5000多项任务,包括车间生产、商超理货、农业生产、医疗护理,甚至非遗技艺、体育运动等技能,也能成为训练机器人的数据来源。每次工作时长和报酬因内容不同有所区别,大致为2分钟到90分钟不等,价格从6元到30元不等。

其中最受欢迎的是居住类场景,包括物品收纳、家居清扫、厨房整理等。这类场景贴近普通人的日常生活,采集门槛极低,任务完成自由度高,大部分名额已经被抢空。

42岁的网约车运营人员李国英是较早一批参与数据采集的众包用户。结束白天的跑车工作后,他回到家就会戴上平台提供的MEgo数采设备,记录浇花、擦玻璃、整理桌面和文件的过程。大约15分钟后,他将数据上传至觅蜂派App,通过审核后获得任务收益。

众包模式的两道必答题

在数据如何被使用、最终服务于谁的问题上,Figure的Index与觅蜂派的方向各不相同。Index主要围绕Figure自身的模型训练需求建立数据闭环;觅蜂派则面向不同模型厂商、机器人企业和数据采购方,根据客户训练需求组织数据生产,将处理后的数据作为产品与服务对外交付。

能否跑通这套商业模式,觅蜂需要回答两个问题:一是谁会买数据、用数据?姚卯青将目标客群归纳为三类。第一类是具身智能企业,需要大批量的无本体众包数据用于基座预训练,帮模型建立通用的动作表征与环境感知能力;也需要对应本体的真机数据开展场景后训练,定向优化特定任务的成功率;第二类是世界模型创业公司,高度依赖第一视角的真实交互数据学习物理规律、动作逻辑与空间表征;第三类是头部大模型厂商。“大模型企业要进一步提升模型本身的智能能力,必须要进入真实世界去闭环、去决策这些数据。”姚卯青说。

据了解,觅蜂百万小时级无本体数据已开始服务腾讯Robotics X实验室、蚂蚁灵波等头部客户,根据不同模型训练需求提供相应的数据产品与服务。

另一个问题是,众包模式能够快速扩大产能,但分散在全国各地的采集者,如何保证数据输出质量?

觅蜂给出的方法是“硬件统一打底+自动化质检为主+分级价值复用”的全链路管控。所有众包人员使用MEgo系列采集设备,从硬件端就拉平采集标准;其次,端侧设备做基础合规校验,云端引擎自动完成画面切片、动作识别、隐私脱敏和质量打分,再辅以人工抽检。同时,按质量打上分级标签,匹配预训练、微调等不同阶段的模型需求。最终通过结算环节的数据,超过95%能进入模型训练环节。

从全球范围看,Figure的Index平台、国内的觅蜂派等玩家,都在验证众包数采的可行性,但赛道远未到终局,数据确权、定价标准、安全合规等行业共性规则仍待建立,从百万小时到亿小时的规模跨越,还需要更多模式创新。

可以确定的是,具身智能的数据供给,已经告别“一拥而上建工厂”的野蛮生长阶段,正在走向分工更清晰、模式更多元的成熟期。

排版/ 季嘉颖

本文为转载内容,授权事宜请联系原著作权人。