临汾家具封边胶厂 看了20万小时「人类干活实录」,机器人悟了

发布日期:2026-07-20 点击次数:144
保温护角专用胶

刚刚,机器人圈公认难的「务大考」RoboCasa-365临汾家具封边胶厂,榜换人了。

新纪录62.6,比之前的 SOTA 直接出8.4个百分点。

要知道,这个榜上大部分模型还在 50 以下挣扎。

有意思的是,登顶的这个名字,之前几乎没人听说过:Riemann-1.0,黎曼动力。

查,好伙,秀。这个模型才刚在 WAIC 2026 上正式发布。

跑分说明不了切,我又去翻了它的真机。

随手点开段机器人收拾餐桌的 demo,只能说,榜单没骗人。

薄薄贴在桌面上的勺子,夹得起来;碗里剩的汤,知道先倒了再收;完事了还顺手把桌子擦干净。

(完了,估计连老妈以后的台词都要改了:连机器人都比你眼里有活儿 ~)

再往上扒,黎曼动力背后站着的是昆仑万维——前者正是昆仑万维为具身智能向成立的子公司。

个新面孔,凭什么秀就登顶?

答案藏在它的「食谱」里:23.2 万小时训练数据中,占大头的根本不是机器人数据,是人的。

没错临汾家具封边胶厂,人做饭、叠衣服、收拾桌子的视角。

造机器人大脑,行业吵出了新共识

为什么是「人的」?这还要从具身智能域吵了年多的路线之争说起。

VLA 和世界模型,谁代表机器人的未来?行业曾为此分裂成鲜明两派。

两派各有优劣,为便于大做对比,这里我直接放了张 AI 生成的图表:

图片由 AI 生成

简单总结就是,VLA 属于「直觉派」,快但容易翻车;世界模型则属于「思派」,稳但是又慢又贵。

吵着吵着大发现:了,既然各有优劣,那不个取长补短?

于是,两条路线开始流。

今年 6 月,英伟达西雅图机器人实验室发布了篇长文综述,文章的核心判断是:

World Action Model(WAM,世界动作模型)已经从 VLA 研究里的小众分支,迅速长成了机器人基础模型的二条主路线,而下代机器人基础模型,大概率是两者的混体。

图源:英伟达官技术博客

ICML 2026 上,包括 LeCun 团队在内的多篇论文也在往同个向使劲:

从海量标注的野外(in-the-wild videos)里学习潜在动作世界模型。

图源:ICML 官网

把这些工作放在起看,条正在被越来越多团队验证的训练范式浮出水面:

先用大规模开放世界做预训练,让模型看遍人类怎么和物理世界交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号。

这就解释了,为什么下代机器人大脑,都盯上了「人的」。

对机器人来说,人类每天的生活就是场不间断的操作示范。做饭、叠衣服、整理房间,这些视角里,藏着人类怎么感知环境、规划动作、处理意外的全部秘密。

而且这类数据要多少有多少,场景丰富,还在源源不断地增长。

实际上,行业里少部分前沿玩已经看到了这点。比如 Being-H0.7 用了 20 万小时视角人类,Generalist AI 的 GEN-1 是了 50 万小时可穿戴设备采集的人类数据。

作为其中之,Riemann-1.0 的特之处在于:

它是国内较早把这条范式完整工程化跑通的选手,从仿真 Benchmark 到真机均获得验证的那种。

而它之所以能跑通,关键在于解决了个核心难题:人类里没有机器人动作标签。

没错,再漂亮的范式,也有自己的问题要解决。

人叠衣服的看得再多,机器人手臂该转多少度、夹爪该用多大力,里个字都没写。

看得懂,做不出。

20 万 + 小时人类干活的,怎么变成机器人手上的活儿?

这正是 Riemann-1.0 故事的起点。

23.2 万小时,怎么变成机器人的手艺

Riemann-1.0,款面向通用机器人操作的世界模型(World Action Model)。

从名字就能看出来,它正是前文说的「混体」:

VLA 的手它有(直接出动作),世界模型的脑它也有(预演世界演化),两派的活儿,个模型全包了。

而它要攻克的,正是行业面前那道共同的坎:

怎么把没有动作标签、来源五花八门的开放世界数据,变成机器人可执行的控制能力,而且要跨机器人本体通用。

Riemann-1.0 的解法,用做菜来类比,可以拆成三步。

Part 1:准备食材

数据就是食材。

仔细扫 Riemann-1.0 的案板,只见上面摆着这样「三道菜」:

「广菜」:20 万 + 小时人类视角;

「精菜」:1.2 万 + 小时 UMI 与外骨骼手套数据;

「准菜」:2 万 + 小时机器人真机与仿真轨迹。

三种数据来源,23.2 万小时训练数据,覆盖 41 种机器人本体、数千种交互式。

就这个规模,不得不说,已经足够机器人把人间烟火看个遍了(doge)。

图片由 AI 生成

不过,食材多,不等于能直接开席。

尤其是占大头的那道「广菜」:20 万 + 小时人类,没洗没切,连动作标签都没有,没法直接下锅。

怎么办?先备菜。

Part 2:备菜

黎曼动力为此自研了套自动化人类数据处理流水线,门负责洗菜切菜。

这套流水线怎么干活?不妨在头脑中想象,你正在跟着段走遍:

段「人在厨房切菜的视角」进厂,件事是摆正。

鱼眼镜头的畸变、歪了倒了的画面,统统矫正成正视图,便后面下刀。

接着 VLM 上场,把长切成个个细粒度动作,给每段配上任务描述、动作指令、场景和物体信息。

切完还得过两轮致校验,标得对不上的,倒重来。

切好的片段紧接着过质检。

画面里人太多的、动作没意义的、遮挡严重的、活儿没干完的、不是视角的、手出了画面的,六类废片,直接进垃圾桶。

活下来的片段,迎来整条流水线上核心的步:给手建 3D 模。

系统检测并追踪画面里的手,重建出完整的手部姿态,再配相机位姿估计,把手的运动轨迹换进世界坐标系,后做整段平滑。

到这步,里「手怎么动」,次变成了机器可读的 3D 坐标。

当然,重建的质量也得把关。

手看不清的、动得太快的、镜头晃太狠的临汾家具封边胶厂,按阈值再筛轮,和前面的语义质检互为补充。

后步是装盘:按场景、任务、动作、技能、物体五个层分好类,均衡配比,止模型偏食。

段段这样走下来,海量「人类干活的录像」,就变成了本机器人能读懂的「动作教材」。

P.S. 另外两道菜由于自带夹爪传感,业界已有相对成熟的处理流水线,这里就不多展开了。

Part 3:炒菜

食材备好,现在终于可以开火了。

炒菜讲究法和火候,对应到模型上,泡沫板橡塑板专用胶就是架构和训练策略。

架构上,Riemann-1.0 基于扩散架构,提出了全因果动作 - 联建模框架,把视觉动态、环境状态和机器人动作序列,放进同个生成过程中统学习。

这意味着,模型不只是知道「眼前看到了什么」,还在学习「动作会如何改变环境,以及下刻世界可能变成什么样」。

而为了让同个模型适配 41 种不同形态的机器人本体,Riemann-1.0 进步设计了本体属的动作映射模块:

共享对世界的理解,同时保留不同机器人的「肢体适配能力」。

说到底,它试图造的是个负责理解环境、预测变化的「通用世界大脑」,然后通过不同机器人的动作适配器,把这种理解转化为具体的执行能力。

再说火候。

训练分三段,秘诀藏在组数字里:动作损失权重 0.1 → 0.5 → 0.9。

阶段,小火慢炖。用 Latent Action Model 从海量人类里提取伪动作信号,动作权重只给 0.1,让模型安心看片,先学会物理世界的运行规律。

二阶段,中火调味。引入 UMI 和机器人真实动作数据做校准,权重拉到 0.5,把伪动作空间平滑过渡到真实控制空间。

三阶段,大火收汁。纯机器人数据集中强化,权重到 0.9,火力全开练出能直接上岗的真功夫。

从「以理解世界为主」渐进切换到「以执行动作为主」,有点像大模型训练里从预训练到对齐的路径,只不过载体从文本换成了物理世界的动作。

好了,菜出锅了,该尝尝味道了。

加味人类,猛涨 14.4 个百分点

先要验证的就是那个灵魂问题:绕这么大圈用人类,真的有用吗?

消融实验给出了非常硬的答案。

在门考察长序列务能力的 RoboCasa-365 上,模型从头训练,成功率 38.2;加机器人数据预训练,43.4,涨 5.2 个百分点;再加 UMI 数据,48.2,又涨 4.8 个百分点。

然后,加入人类数据:62.6。

下子猛增了 14.4 个百分点,比前两类数据的增益加起来还多。

Riemann-1.0 团队认为:

这说明人类数据带来的远不止「多训练样本」,它给模型灌进了丰富的物体交互式、动作语义和任务先验,直接抬了模型在没见过的场景里的泛化上限。

另组严格控制变量的实验狠。

在为双灵巧手人形机器人设计的 EgoVLA 基准测试中,同样的模型、同样的机器人数据,仅仅比较加不加人类预训练:

长程多阶段任务的成功率,从 42.96 干到 71.11,暴涨 28 个百分点;

换成没见过的视觉背景,也从 26.36 提到 43.33。

任务链越长、场景越陌生,人类数据的价值越大。

搞定这个基础问题,后来看整体成绩单。

先看仿真端的三张考卷:

LIBERO,业内常用的标准操作评测,考基本功,Riemann-1.0 成功率 99.0;

RoboTwin 2.0,主双臂协作任务的仿真基准,成功率 94.3;

RoboCasa-365,前面说的难务大考,62.6,登顶 SOTA。

显而易见,Riemann-1.0 基本功评测稳居梯队,而优势明显的,恰恰是 RoboCasa-365 这种强调庭长流程、跨场景泛化的考试。

不过,仿真刷榜终究是模拟考,真机上岗才是真考验。

上岗之前,团队先给模型安排了轮「岗前实训」:针对真实落地场景的项后训练。

他们搭建了四类代表的务考场:有序积木堆叠,考操控和指令理解;柔布料折叠,考形变物体的交互处理;桌面杂物整理和厨房餐具收纳,考杂乱居环境下的长流程连续操作。

示范数据靠人工遥操作采集,四类场景并做联训练。

为了公平,参与对比的开源基座模型也拿同样的数据、同样的训练步数做了后训练,站在同条起跑线上。

结果 Riemann-1.0 平均成功率 85.00,过程完成度(衡量长流程中间步骤进的指标)94.43,两项都在所有对比法里排名,先好的开源模型 15 个百分点。

而且四类任务成功率全部 80,每项的过程完成度都在 91 以上。

翻译翻译,不光结果能干成,中间每步也走得稳,长流程不掉链子。

从仿真登顶到真机上岗,Riemann-1.0 把「看人类学干活」这条路,从头到尾走通了。

One More Thing

后说回黎曼动力本身。看到这公司眼,我就在想:

昆仑万维,个印象中涉足 AI 游戏、AI 音乐、AI 短剧等内容赛道的公司,怎么突然干起机器人了?

还门成立个子公司立运营?

理了理,背后其实是两条逻辑线的交汇。

条属于行业。为什么人人都在谈具身智能、世界模型这些?本质上是因为交互式正在发生变革。

人和 AI 的交互,前几年靠文字、图片、音;接下来,AI 要开始伸手碰物理世界了。

内容公司做机器人,看似突兀,放进这个大转向里,只是早晚问题。

另条属于昆仑万维自己。它的下场,早有铺垫。

早前那些频的模型新就不说了,就说这次它主办的《世界模型与多模态范式跃迁》论坛,其实共亮相了三款模型:

Matrix-3.5 世界模型(升):可交互能力实现跃迁,通数字孪生与具身智能底层底座;

Mureka v9.5(升):AI 音乐创作走向量产落地;

机器人模型 Riemann-1.0(发):通世界模型与实体机器人交互闭环。

看出门道了吗?前两个管数字世界的生成,三个开始伸手碰真实世界。

尤其是世界模型这块底座,头连着游戏和;另头,次连上了实体机器人。

数字满,下张落在物理世界,水到渠成。

两条线在这里交汇,就有了黎曼动力。

至于为什么单成立公司?昆仑万维的逻辑并不复杂:

机器人这种硬核赛道没有速胜,得让核心团队立发展、配上属资源、做长期投入。

母公司出力、出生态,团队心跑技术,各展所长。

套动作下来,昆仑万维,这几年前就把「实现 AGI」写进公司使命的玩,次真正把手伸进了物理世界。

AGI 的上半场在屏幕里,下半场,在屏幕外。

向已明,剩下的,就看谁跑得快了。

键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

� � 点亮星标 � �

科技前沿进展每日见相关词条:储罐保温     异型材设备     钢绞线厂家    玻璃丝棉厂家    万能胶厂家

奥力斯    PVC管道管件粘结胶价格     联系人:王经理    手机:18231788377(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区/p>

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述临汾家具封边胶厂,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

首页
电话咨询
QQ咨询
联系奥力斯