淮北PVC管道管件粘结胶 100万小时之后,机器人为什么还喊“饿”?
100万小时,还不够。
觅蜂科技是智元机器人内部孵化的控股子公司,今年2月成立,定位为物理AI数据服务商。
8月31日,智元机器人内部孵化的控股子公司觅蜂科技,宣布MEgo系列2万套设备正式下线,同时发布百万小时本体数据集。这批数据覆盖22大类场景、500余种任务类型、过1万个真实场景和5万余个物体类别。
图片来源:觅蜂科技
此时,距离觅蜂科技成立不过半年时间,也成为了行业对外宣布百万小时别的本体数据产能的公司。
但同天,觅蜂科技董事长兼CEO姚卯青又把行业的下阶段目标指向了另个数量:“通往AGI,物理AI终需要上千万、上亿小时的数据,今天只是起点。”
100万到1亿,意味着100倍。
这个巨大的缺口,很容易让人产生种熟悉的感觉。
过去几年,大模型行业已经经历过类似的Scaling叙事:多数据、大参数、多力,然后等待能力在某个节点突然涌现。
现在,这套逻辑似乎正在被搬到机器人身上。
于是,数采工厂越来越多,本体设备开始量产,真实世界数据被按“小时”计,百万小时之后又出现千万、亿小时的目标。
但个基础的问题反而值得先问:具身智能真的已经知道自己需要1亿小时什么样的数据了吗?
如果这个问题还没有答案,那么“百万小时”究竟意味着机器人距离通用智能近了步,还是仅仅意味着人类次具备了大规模生产物理世界数据的能力?
两者其实并不是回事。
大模型的Scaling,不能简单复制给机器人
机器人缺数据,这点并不难理解。
语言模型拥有个优势:人类过去几十年已经把大量知识数字化。
网页、书籍、论坛、代码、图片、,本身就是现成的训练材料。
但机器人终要解决的是物理世界的问题。
怎么拿起个杯子、怎样折叠衣服、怎样把不同材质的物品放进货架——这些人类习以为常的操作经验,并没有存在于互联网上。
姚卯青表示,目前物理AI的数据规模相比语言模型还小了“四五个数量”。在他看来,机器人真正的技能来自经验,“只有见过才会,才能再举反三”。
问题在于:“机器人缺数据”和“机器人需要1亿小时数据”,中间其实还隔着很远。
大模型Scaling成立的个重要基础,是文本、图像等数据拥有相对成熟的Token化式,模型架构、训练目标和评测体系也逐渐收敛。
物理世界却复杂得多。
同样是“拿起杯子”,不同机器人可能拥有二指夹爪、五指灵巧手;不同本体的自由度、尺寸、力矩和控制频率都不同。人类完成次动作产生的数据,也未能够直接变成机器人的控制信号。
重要的是,今天的具身智能甚至还没有回答个基础问题:到底什么数据有用?
是1000个庭里各做次叠衣服,还是个机器人把叠衣服做10万次?
是人的视角重要,还是机器人的关节轨迹重要?
是让模型见过多任务重要,还是让它把少数任务做得足够可靠重要?
这些问题目前并没有统答案。
所以,“1亿小时”至少在今天还不能被理解为类似“训练某个模型至少需要多少Token”的工程结论。
它多代表的是种产业判断:如果具身智能终需要通向开放世界的泛化能力,那么今天的数据规模远远不够。
至于究竟差多少,行业还在摸索。
为什么“本体”偏偏在这个时候火了?
也正是在这种背景下,本体数据开始迅速升温。
过去获取机器人数据,个直接的办法是让机器人自己干。
操作员通过遥操作控制机器人完成抓取、搬运、整理等任务,机器人看到什么、关节如何运动、末端执行器经过怎样的轨迹,都同步记录下来。
优点是数据贴近机器人。
缺点同样突出——生产率太低。
京东科技集团总裁何贺在现场回忆,年前进行物理世界数据采集时,操作员带着机器人工作8小时,终可能只有1小时有数据,同时还要承担机器人、电费、人工和场地成本。
姚卯青则给出了另个数字:现在几万小时真机数据已经成为些模型比较普遍的需求,而几万小时真机数据,可能就需要上千台机器人持续采集半年。
这恰恰暴露了个矛盾。
边是行业开始相信数据应该Scaling;
另边是传统数据生产式根本Scale不起来。
本体数据,本质上是在解决这个矛盾。
人不再需要遥操作台真正的机器人,而可以佩戴视角、腕部设备,或者拿着夹爪直接完成任务。
觅蜂此次公布的100万小时数据中,50万小时来自裸手采集,35万小时来自腕部采集,15万小时来自Gripper夹爪采集。
现场食堂里的对比加直观。
传统遥操作8小时可能得到1小时有数据,而餐饮、保洁工作人员正常工作时佩戴设备,8小时多可以产生5—6小时数据。
所以,本体的出现先解决的并不是“机器人怎样变聪明”。
而是个加现实的问题:怎样把物理世界的数据生产成本降下来。
这是两个不同的问题。
能够便宜地生产100万小时数据,并不意味着这些数据定能够带来与数量成比例的模型能力提升。
这也是看待此次“百万小时”需要区分的地。
它先证明的是数据生产能力,而不是模型能力。
100万小时大的价值,可能不是“100万”
事实上,即使是觅蜂自己,也没有把所有筹码押在小时数上。
此次公布的100万小时数据同时强调了22大类场景、500余种任务、过1万个真实场景和5万余个物体类别。
这背后其实暴露出具身智能Scaling与大模型Scaling个非常不同的问题:物理世界的数据很难只用“小时”衡量。
两个数据集都可以叫100万小时。
个可能来自大量重复任务,另个可能覆盖不同的环境、物体和操作,两者对于模型的意义显然不同。
同样,万能胶厂家段30分钟的数据里,也可能真正有价值的操作只有几分钟。
所以小时数是容易理解、容易传播、也容易被产业统计的指标,却未是衡量具身数据价值准确的尺度。
这也是为什么,今天看到“百万小时”“千万小时”“亿小时”这些数字时,需要保持点距离。
它们说明供给规模正在迅速扩大,却不能直接等价为机器人能力的提升。
真正需要观察的是另条曲线:
当数据从10万小时增加到100万小时,模型到底提升了多少?
成功率提了吗?
没有见过的环境中,泛化能力提了吗?
换个机器人本体之后,原来学到的能力还能保留多少?
过去不会做的任务,因为这些数据学会了吗?
如果这些问题没有对应答案,那么数据规模本身很容易变成个漂亮但缺乏解释力的产业KPI。
至少此次发布会上,觅蜂多展示的是数据规模、覆盖范围、采集和理能力;至于百万小时数据能够给某个具体模型带来多少能力增益,现场尚没有给出组可以与数据规模直接对应的完整结果。
因此,“行业个百万小时”值得记录,但它还不是个类似“大模型参数跨过某个节点之后出现能力涌现”的技术证明。
这是需要分清的。
机器人需要的,到底是“见得多”还是“练得多”?
再往前步,具身智能还有个比数据量根本的问题。
人的学习并不是简单复制过去见过的所有动作。
个人次学会开某种抽屉之后,换间房、换个把手、换个度,大概率仍然知道“拉开抽屉”这件事情应该怎么做。
机器人追求的终也是这种能力。
也就是泛化。
从这个意义上说,真实世界大规模数据的价值很好理解:
实验室可以搭个餐厅,却很难搭出1000个不同的餐厅。
真实世界里的光线、桌面度、物品位置、人流和干扰每时每刻都在变化。机器人见过的环境越多,理论上越有机会学习到任务背后加通用的规律。
这也是本体数据有吸引力的地。
它把数据源从有限的机器人实验室扩展到了真实世界。
但这仍然只解决了半问题。
见得足够多,不等于做得足够好。
人类的身体和机器人不同。
人的操作经验可以告诉模型“杯子应该这样拿”,却不能保证某台机器人知道自己的几个关节应该转多少度、夹爪应该施加多少力。
因此,本体与真机之间并不是简单的替代关系。
姚卯青在群访中也承认,本体多用于预训练和通用表征学习,而真正针对具体机器人、具体任务进行后训练和落地时,“肯定绕不开对应本体的真机数据”。
腾讯Robotics X实验室产品生态负责人朱亚娟的说法也很谨慎:本体的“异构+Gripper”可以“定程度上”替代过去通过本体遥操作解决的问题,但跨本体迁移中精细动作的对齐,仍然需要真机数据来校准。
这两个限定词其实比“百万小时”值得关注。
因为它说明,行业现在仍然没有找到种可以包天下的数据。
机器人既需要“见得多”,也需要“练得多”。
而这两种需求究竟应该如何组,目前仍然处于探索阶段。
具身智能的“Scaling Law”,还没有被证明
所以,回到开始的问题:100万小时,还不够机器人“吃”吗?
答案可能是——至少在今天,这个问题还没有答案。但真正值得注意的是另件事:行业已经开始用“数据规模化”来回答这个问题——而规模化本身,也可能成为答案的部分。
姚卯青认为,上亿小时才能预训练出足够好的具身基座模型。
这个判断并非没有逻辑。
如果目标是让机器人进入庭、商场、工厂、仓库乃至多开放环境,那么它面对的物体、任务和环境组几乎限,现有数据显然远远覆盖不完。
但从100万到1亿之间,并不存在条已经被验证的Scaling Law。
1000万小时是否会出现能力跃迁?
5000万和1亿有什么本质差异?
模型架构进步之后,数据需求会不会反而下降?
不同数据之间应该按照什么比例组?
这些问题目前都没有确定答案。
因此,此次百万小时数据准确的意义,或许不是证明“机器人距离AGI又近了1”。
AGI不是个可以简单用数据小时数计的进度条。
它真正说明的是另件事情:
物理世界的数据,正在次具备被工业化生产的可能。
两万套采集设备、百万小时数据、真实场景采集,以及越来越业的数据加工链路,共同指向个新产业正在形成——人类过去没有被记录下来的物理操作经验,开始被系统地数字化。
至于这些数据终能在多大程度上动机器人能力Scaling,仍然需要模型训练和真实部署来回答。
所以,对于今天的具身智能而言,真正值得警惕的不是数据太多,而是过早把“数据规模扩大”和“智能能力提升”画上等号。
百万小时之后,行业当然还会继续追逐千万小时、亿小时。
但下阶段需要证明的,不应该只是数字还能不能继续变大。
而是机器人是不是真的因此变得聪明了。
换句话说:数据产能的工业化,与智能能力的涌现,是两件立的事。 前者正在发生,后者仍待验证。而把两者混为谈,恰恰是当前具身智能叙事中需要警惕的部分。
当然,在证明这点之前,还有个加现实的问题。
如果行业真的准备向1亿小时迈进,剩下的9900万小时,到底从哪里来?
这将是这个系列下篇要讨论的问题。 相关词条:玻璃棉 塑料挤出机厂家 钢绞线 管道保温 PVC管道管件粘结胶
奥力斯 泡沫板橡塑板专用胶报价 联系人:王经理 手机:18232851235(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》淮北PVC管道管件粘结胶,以此来变相勒索商家索要赔偿的违法恶意行为。