淮北PVC管道管件粘结胶 100万小时之后,机器人为什么还喊“饿”?

产品中心 2026-09-05 20:13:35 69
管件胶厂家

100万小时,还不够。

觅蜂科技是智元机器人内部孵化的控股子公司,今年2月成立,定位为物理AI数据服务商。

8月31日,智元机器人内部孵化的控股子公司觅蜂科技,宣布MEgo系列2万套设备正式下线,同时发布百万小时本体数据集。这批数据覆盖22大类场景、500余种任务类型、过1万个真实场景和5万余个物体类别。

    

图片来源:觅蜂科技

此时,距离觅蜂科技成立不过半年时间,也成为了行业对外宣布百万小时别的本体数据产能的公司。

但同天,觅蜂科技董事长兼CEO姚卯青又把行业的下阶段目标指向了另个数量:“通往AGI,物理AI终需要上千万、上亿小时的数据,今天只是起点。”

100万到1亿,意味着100倍。

这个巨大的缺口,很容易让人产生种熟悉的感觉。

过去几年,大模型行业已经经历过类似的Scaling叙事:多数据、大参数、多力,然后等待能力在某个节点突然涌现。

现在,这套逻辑似乎正在被搬到机器人身上。

于是,数采工厂越来越多,本体设备开始量产,真实世界数据被按“小时”计,百万小时之后又出现千万、亿小时的目标。

但个基础的问题反而值得先问:具身智能真的已经知道自己需要1亿小时什么样的数据了吗?

如果这个问题还没有答案,那么“百万小时”究竟意味着机器人距离通用智能近了步,还是仅仅意味着人类次具备了大规模生产物理世界数据的能力?

两者其实并不是回事。

大模型的Scaling,不能简单复制给机器人

机器人缺数据,这点并不难理解。

语言模型拥有个优势:人类过去几十年已经把大量知识数字化。

网页、书籍、论坛、代码、图片、,本身就是现成的训练材料。

但机器人终要解决的是物理世界的问题。

怎么拿起个杯子、怎样折叠衣服、怎样把不同材质的物品放进货架——这些人类习以为常的操作经验,并没有存在于互联网上。

    

姚卯青表示,目前物理AI的数据规模相比语言模型还小了“四五个数量”。在他看来,机器人真正的技能来自经验,“只有见过才会,才能再举反三”。

问题在于:“机器人缺数据”和“机器人需要1亿小时数据”,中间其实还隔着很远。

大模型Scaling成立的个重要基础,是文本、图像等数据拥有相对成熟的Token化式,模型架构、训练目标和评测体系也逐渐收敛。

物理世界却复杂得多。

同样是“拿起杯子”,不同机器人可能拥有二指夹爪、五指灵巧手;不同本体的自由度、尺寸、力矩和控制频率都不同。人类完成次动作产生的数据,也未能够直接变成机器人的控制信号。

重要的是,今天的具身智能甚至还没有回答个基础问题:到底什么数据有用?

是1000个庭里各做次叠衣服,还是个机器人把叠衣服做10万次?

是人的视角重要,还是机器人的关节轨迹重要?

是让模型见过多任务重要,还是让它把少数任务做得足够可靠重要?

这些问题目前并没有统答案。

所以,“1亿小时”至少在今天还不能被理解为类似“训练某个模型至少需要多少Token”的工程结论。

它多代表的是种产业判断:如果具身智能终需要通向开放世界的泛化能力,那么今天的数据规模远远不够。

至于究竟差多少,行业还在摸索。

为什么“本体”偏偏在这个时候火了?

也正是在这种背景下,本体数据开始迅速升温。

过去获取机器人数据,个直接的办法是让机器人自己干。

操作员通过遥操作控制机器人完成抓取、搬运、整理等任务,机器人看到什么、关节如何运动、末端执行器经过怎样的轨迹,都同步记录下来。

优点是数据贴近机器人。

缺点同样突出——生产率太低。

京东科技集团总裁何贺在现场回忆,年前进行物理世界数据采集时,操作员带着机器人工作8小时,终可能只有1小时有数据,同时还要承担机器人、电费、人工和场地成本。

    

姚卯青则给出了另个数字:现在几万小时真机数据已经成为些模型比较普遍的需求,而几万小时真机数据,可能就需要上千台机器人持续采集半年。

这恰恰暴露了个矛盾。

边是行业开始相信数据应该Scaling;

另边是传统数据生产式根本Scale不起来。

本体数据,本质上是在解决这个矛盾。

人不再需要遥操作台真正的机器人,而可以佩戴视角、腕部设备,或者拿着夹爪直接完成任务。

觅蜂此次公布的100万小时数据中,50万小时来自裸手采集,35万小时来自腕部采集,15万小时来自Gripper夹爪采集。

    

现场食堂里的对比加直观。

传统遥操作8小时可能得到1小时有数据,而餐饮、保洁工作人员正常工作时佩戴设备,8小时多可以产生5—6小时数据。

所以,本体的出现先解决的并不是“机器人怎样变聪明”。

而是个加现实的问题:怎样把物理世界的数据生产成本降下来。

这是两个不同的问题。

能够便宜地生产100万小时数据,并不意味着这些数据定能够带来与数量成比例的模型能力提升。

这也是看待此次“百万小时”需要区分的地。

它先证明的是数据生产能力,而不是模型能力。

100万小时大的价值,可能不是“100万”

事实上,即使是觅蜂自己,也没有把所有筹码押在小时数上。

此次公布的100万小时数据同时强调了22大类场景、500余种任务、过1万个真实场景和5万余个物体类别。

这背后其实暴露出具身智能Scaling与大模型Scaling个非常不同的问题:物理世界的数据很难只用“小时”衡量。

两个数据集都可以叫100万小时。

个可能来自大量重复任务,另个可能覆盖不同的环境、物体和操作,两者对于模型的意义显然不同。

同样,万能胶厂家段30分钟的数据里,也可能真正有价值的操作只有几分钟。

所以小时数是容易理解、容易传播、也容易被产业统计的指标,却未是衡量具身数据价值准确的尺度。

这也是为什么,今天看到“百万小时”“千万小时”“亿小时”这些数字时,需要保持点距离。

它们说明供给规模正在迅速扩大,却不能直接等价为机器人能力的提升。

真正需要观察的是另条曲线:

当数据从10万小时增加到100万小时,模型到底提升了多少?

成功率提了吗?

没有见过的环境中,泛化能力提了吗?

换个机器人本体之后,原来学到的能力还能保留多少?

过去不会做的任务,因为这些数据学会了吗?

如果这些问题没有对应答案,那么数据规模本身很容易变成个漂亮但缺乏解释力的产业KPI。

至少此次发布会上,觅蜂多展示的是数据规模、覆盖范围、采集和理能力;至于百万小时数据能够给某个具体模型带来多少能力增益,现场尚没有给出组可以与数据规模直接对应的完整结果。

因此,“行业个百万小时”值得记录,但它还不是个类似“大模型参数跨过某个节点之后出现能力涌现”的技术证明。

这是需要分清的。

机器人需要的,到底是“见得多”还是“练得多”?

再往前步,具身智能还有个比数据量根本的问题。

人的学习并不是简单复制过去见过的所有动作。

个人次学会开某种抽屉之后,换间房、换个把手、换个度,大概率仍然知道“拉开抽屉”这件事情应该怎么做。

机器人追求的终也是这种能力。

也就是泛化。

从这个意义上说,真实世界大规模数据的价值很好理解:

实验室可以搭个餐厅,却很难搭出1000个不同的餐厅。

真实世界里的光线、桌面度、物品位置、人流和干扰每时每刻都在变化。机器人见过的环境越多,理论上越有机会学习到任务背后加通用的规律。

这也是本体数据有吸引力的地。

它把数据源从有限的机器人实验室扩展到了真实世界。

但这仍然只解决了半问题。

见得足够多,不等于做得足够好。

人类的身体和机器人不同。

人的操作经验可以告诉模型“杯子应该这样拿”,却不能保证某台机器人知道自己的几个关节应该转多少度、夹爪应该施加多少力。

因此,本体与真机之间并不是简单的替代关系。

姚卯青在群访中也承认,本体多用于预训练和通用表征学习,而真正针对具体机器人、具体任务进行后训练和落地时,“肯定绕不开对应本体的真机数据”。

腾讯Robotics X实验室产品生态负责人朱亚娟的说法也很谨慎:本体的“异构+Gripper”可以“定程度上”替代过去通过本体遥操作解决的问题,但跨本体迁移中精细动作的对齐,仍然需要真机数据来校准。

这两个限定词其实比“百万小时”值得关注。

因为它说明,行业现在仍然没有找到种可以包天下的数据。

机器人既需要“见得多”,也需要“练得多”。

而这两种需求究竟应该如何组,目前仍然处于探索阶段。

具身智能的“Scaling Law”,还没有被证明

所以,回到开始的问题:100万小时,还不够机器人“吃”吗?

答案可能是——至少在今天,这个问题还没有答案。但真正值得注意的是另件事:行业已经开始用“数据规模化”来回答这个问题——而规模化本身,也可能成为答案的部分。

姚卯青认为,上亿小时才能预训练出足够好的具身基座模型。

这个判断并非没有逻辑。

如果目标是让机器人进入庭、商场、工厂、仓库乃至多开放环境,那么它面对的物体、任务和环境组几乎限,现有数据显然远远覆盖不完。

但从100万到1亿之间,并不存在条已经被验证的Scaling Law。

1000万小时是否会出现能力跃迁?

5000万和1亿有什么本质差异?

模型架构进步之后,数据需求会不会反而下降?

不同数据之间应该按照什么比例组?

这些问题目前都没有确定答案。

因此,此次百万小时数据准确的意义,或许不是证明“机器人距离AGI又近了1”。

AGI不是个可以简单用数据小时数计的进度条。

它真正说明的是另件事情:

物理世界的数据,正在次具备被工业化生产的可能。

两万套采集设备、百万小时数据、真实场景采集,以及越来越业的数据加工链路,共同指向个新产业正在形成——人类过去没有被记录下来的物理操作经验,开始被系统地数字化。

至于这些数据终能在多大程度上动机器人能力Scaling,仍然需要模型训练和真实部署来回答。

所以,对于今天的具身智能而言,真正值得警惕的不是数据太多,而是过早把“数据规模扩大”和“智能能力提升”画上等号。

百万小时之后,行业当然还会继续追逐千万小时、亿小时。

但下阶段需要证明的,不应该只是数字还能不能继续变大。

而是机器人是不是真的因此变得聪明了。

换句话说:数据产能的工业化,与智能能力的涌现,是两件立的事。 前者正在发生,后者仍待验证。而把两者混为谈,恰恰是当前具身智能叙事中需要警惕的部分。

当然,在证明这点之前,还有个加现实的问题。

如果行业真的准备向1亿小时迈进,剩下的9900万小时,到底从哪里来?

这将是这个系列下篇要讨论的问题。 相关词条:玻璃棉     塑料挤出机厂家     钢绞线    管道保温    PVC管道管件粘结胶

奥力斯    泡沫板橡塑板专用胶报价    联系人:王经理    手机:18232851235(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》淮北PVC管道管件粘结胶,以此来变相勒索商家索要赔偿的违法恶意行为。