
刚刚,机器人圈公认难的「务大考」RoboCasa-365临汾家具封边胶厂,榜换人了。
新纪录62.6,比之前的 SOTA 直接出8.4个百分点。
要知道,这个榜上大部分模型还在 50 以下挣扎。
有意思的是,登顶的这个名字,之前几乎没人听说过:Riemann-1.0,黎曼动力。
查,好伙,秀。这个模型才刚在 WAIC 2026 上正式发布。
跑分说明不了切,我又去翻了它的真机。
随手点开段机器人收拾餐桌的 demo,只能说,榜单没骗人。
薄薄贴在桌面上的勺子,夹得起来;碗里剩的汤,知道先倒了再收;完事了还顺手把桌子擦干净。
(完了,估计连老妈以后的台词都要改了:连机器人都比你眼里有活儿 ~)
再往上扒,黎曼动力背后站着的是昆仑万维——前者正是昆仑万维为具身智能向成立的子公司。
个新面孔,凭什么秀就登顶?
答案藏在它的「食谱」里:23.2 万小时训练数据中,占大头的根本不是机器人数据,是人的。
没错临汾家具封边胶厂,人做饭、叠衣服、收拾桌子的视角。
造机器人大脑,行业吵出了新共识
为什么是「人的」?这还要从具身智能域吵了年多的路线之争说起。
VLA 和世界模型,谁代表机器人的未来?行业曾为此分裂成鲜明两派。
两派各有优劣,为便于大做对比,这里我直接放了张 AI 生成的图表:
图片由 AI 生成
简单总结就是,VLA 属于「直觉派」,快但容易翻车;世界模型则属于「思派」,稳但是又慢又贵。
吵着吵着大发现:了,既然各有优劣,那不个取长补短?
于是,两条路线开始流。
今年 6 月,英伟达西雅图机器人实验室发布了篇长文综述,文章的核心判断是:
World Action Model(WAM,世界动作模型)已经从 VLA 研究里的小众分支,迅速长成了机器人基础模型的二条主路线,而下代机器人基础模型,大概率是两者的混体。
图源:英伟达官技术博客
ICML 2026 上,包括 LeCun 团队在内的多篇论文也在往同个向使劲:
从海量标注的野外(in-the-wild videos)里学习潜在动作世界模型。
图源:ICML 官网
把这些工作放在起看,条正在被越来越多团队验证的训练范式浮出水面:
先用大规模开放世界做预训练,让模型看遍人类怎么和物理世界交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号。
这就解释了,为什么下代机器人大脑,都盯上了「人的」。
对机器人来说,人类每天的生活就是场不间断的操作示范。做饭、叠衣服、整理房间,这些视角里,藏着人类怎么感知环境、规划动作、处理意外的全部秘密。
而且这类数据要多少有多少,场景丰富,还在源源不断地增长。
实际上,行业里少部分前沿玩已经看到了这点。比如 Being-H0.7 用了 20 万小时视角人类,Generalist AI 的 GEN-1 是了 50 万小时可穿戴设备采集的人类数据。
作为其中之,Riemann-1.0 的特之处在于:
它是国内较早把这条范式完整工程化跑通的选手,从仿真 Benchmark 到真机均获得验证的那种。
而它之所以能跑通,关键在于解决了个核心难题:人类里没有机器人动作标签。
没错,再漂亮的范式,也有自己的问题要解决。
人叠衣服的看得再多,机器人手臂该转多少度、夹爪该用多大力,里个字都没写。
看得懂,做不出。
20 万 + 小时人类干活的,怎么变成机器人手上的活儿?
这正是 Riemann-1.0 故事的起点。
23.2 万小时,怎么变成机器人的手艺
Riemann-1.0,款面向通用机器人操作的世界模型(World Action Model)。
从名字就能看出来,它正是前文说的「混体」:
VLA 的手它有(直接出动作),世界模型的脑它也有(预演世界演化),两派的活儿,个模型全包了。
而它要攻克的,正是行业面前那道共同的坎:
怎么把没有动作标签、来源五花八门的开放世界数据,变成机器人可执行的控制能力,而且要跨机器人本体通用。
Riemann-1.0 的解法,用做菜来类比,可以拆成三步。
Part 1:准备食材
数据就是食材。
仔细扫 Riemann-1.0 的案板,只见上面摆着这样「三道菜」:
「广菜」:20 万 + 小时人类视角;
「精菜」:1.2 万 + 小时 UMI 与外骨骼手套数据;
「准菜」:2 万 + 小时机器人真机与仿真轨迹。
三种数据来源,23.2 万小时训练数据,覆盖 41 种机器人本体、数千种交互式。
就这个规模,不得不说,已经足够机器人把人间烟火看个遍了(doge)。
图片由 AI 生成
不过,食材多,不等于能直接开席。
尤其是占大头的那道「广菜」:20 万 + 小时人类,没洗没切,连动作标签都没有,没法直接下锅。
怎么办?先备菜。
Part 2:备菜
黎曼动力为此自研了套自动化人类数据处理流水线,门负责洗菜切菜。
这套流水线怎么干活?不妨在头脑中想象,你正在跟着段走遍:
段「人在厨房切菜的视角」进厂,件事是摆正。
鱼眼镜头的畸变、歪了倒了的画面,统统矫正成正视图,便后面下刀。
接着 VLM 上场,把长切成个个细粒度动作,给每段配上任务描述、动作指令、场景和物体信息。
切完还得过两轮致校验,标得对不上的,倒重来。
切好的片段紧接着过质检。
画面里人太多的、动作没意义的、遮挡严重的、活儿没干完的、不是视角的、手出了画面的,六类废片,直接进垃圾桶。
活下来的片段,迎来整条流水线上核心的步:给手建 3D 模。
系统检测并追踪画面里的手,重建出完整的手部姿态,再配相机位姿估计,把手的运动轨迹换进世界坐标系,后做整段平滑。
到这步,里「手怎么动」,次变成了机器可读的 3D 坐标。
当然,重建的质量也得把关。
手看不清的、动得太快的、镜头晃太狠的临汾家具封边胶厂,按阈值再筛轮,和前面的语义质检互为补充。
后步是装盘:按场景、任务、动作、技能、物体五个层分好类,均衡配比,止模型偏食。
段段这样走下来,海量「人类干活的录像」,就变成了本机器人能读懂的「动作教材」。
P.S. 另外两道菜由于自带夹爪传感,业界已有相对成熟的处理流水线,这里就不多展开了。
Part 3:炒菜
食材备好,现在终于可以开火了。
炒菜讲究法和火候,对应到模型上,泡沫板橡塑板专用胶就是架构和训练策略。
架构上,Riemann-1.0 基于扩散架构,提出了全因果动作 - 联建模框架,把视觉动态、环境状态和机器人动作序列,放进同个生成过程中统学习。
这意味着,模型不只是知道「眼前看到了什么」,还在学习「动作会如何改变环境,以及下刻世界可能变成什么样」。
而为了让同个模型适配 41 种不同形态的机器人本体,Riemann-1.0 进步设计了本体属的动作映射模块:
共享对世界的理解,同时保留不同机器人的「肢体适配能力」。
说到底,它试图造的是个负责理解环境、预测变化的「通用世界大脑」,然后通过不同机器人的动作适配器,把这种理解转化为具体的执行能力。
再说火候。
训练分三段,秘诀藏在组数字里:动作损失权重 0.1 → 0.5 → 0.9。
阶段,小火慢炖。用 Latent Action Model 从海量人类里提取伪动作信号,动作权重只给 0.1,让模型安心看片,先学会物理世界的运行规律。
二阶段,中火调味。引入 UMI 和机器人真实动作数据做校准,权重拉到 0.5,把伪动作空间平滑过渡到真实控制空间。
三阶段,大火收汁。纯机器人数据集中强化,权重到 0.9,火力全开练出能直接上岗的真功夫。
从「以理解世界为主」渐进切换到「以执行动作为主」,有点像大模型训练里从预训练到对齐的路径,只不过载体从文本换成了物理世界的动作。
好了,菜出锅了,该尝尝味道了。
加味人类,猛涨 14.4 个百分点
先要验证的就是那个灵魂问题:绕这么大圈用人类,真的有用吗?
消融实验给出了非常硬的答案。
在门考察长序列务能力的 RoboCasa-365 上,模型从头训练,成功率 38.2;加机器人数据预训练,43.4,涨 5.2 个百分点;再加 UMI 数据,48.2,又涨 4.8 个百分点。
然后,加入人类数据:62.6。
下子猛增了 14.4 个百分点,比前两类数据的增益加起来还多。
Riemann-1.0 团队认为:
这说明人类数据带来的远不止「多训练样本」,它给模型灌进了丰富的物体交互式、动作语义和任务先验,直接抬了模型在没见过的场景里的泛化上限。
另组严格控制变量的实验狠。
在为双灵巧手人形机器人设计的 EgoVLA 基准测试中,同样的模型、同样的机器人数据,仅仅比较加不加人类预训练:
长程多阶段任务的成功率,从 42.96 干到 71.11,暴涨 28 个百分点;
换成没见过的视觉背景,也从 26.36 提到 43.33。
任务链越长、场景越陌生,人类数据的价值越大。
搞定这个基础问题,后来看整体成绩单。
先看仿真端的三张考卷:
LIBERO,业内常用的标准操作评测,考基本功,Riemann-1.0 成功率 99.0;
RoboTwin 2.0,主双臂协作任务的仿真基准,成功率 94.3;
RoboCasa-365,前面说的难务大考,62.6,登顶 SOTA。
显而易见,Riemann-1.0 基本功评测稳居梯队,而优势明显的,恰恰是 RoboCasa-365 这种强调庭长流程、跨场景泛化的考试。
不过,仿真刷榜终究是模拟考,真机上岗才是真考验。
上岗之前,团队先给模型安排了轮「岗前实训」:针对真实落地场景的项后训练。
他们搭建了四类代表的务考场:有序积木堆叠,考操控和指令理解;柔布料折叠,考形变物体的交互处理;桌面杂物整理和厨房餐具收纳,考杂乱居环境下的长流程连续操作。
示范数据靠人工遥操作采集,四类场景并做联训练。
为了公平,参与对比的开源基座模型也拿同样的数据、同样的训练步数做了后训练,站在同条起跑线上。
结果 Riemann-1.0 平均成功率 85.00,过程完成度(衡量长流程中间步骤进的指标)94.43,两项都在所有对比法里排名,先好的开源模型 15 个百分点。
而且四类任务成功率全部 80,每项的过程完成度都在 91 以上。
翻译翻译,不光结果能干成,中间每步也走得稳,长流程不掉链子。
从仿真登顶到真机上岗,Riemann-1.0 把「看人类学干活」这条路,从头到尾走通了。
One More Thing
后说回黎曼动力本身。看到这公司眼,我就在想:
昆仑万维,个印象中涉足 AI 游戏、AI 音乐、AI 短剧等内容赛道的公司,怎么突然干起机器人了?
还门成立个子公司立运营?
理了理,背后其实是两条逻辑线的交汇。
条属于行业。为什么人人都在谈具身智能、世界模型这些?本质上是因为交互式正在发生变革。
人和 AI 的交互,前几年靠文字、图片、音;接下来,AI 要开始伸手碰物理世界了。
内容公司做机器人,看似突兀,放进这个大转向里,只是早晚问题。
另条属于昆仑万维自己。它的下场,早有铺垫。
早前那些频的模型新就不说了,就说这次它主办的《世界模型与多模态范式跃迁》论坛,其实共亮相了三款模型:
Matrix-3.5 世界模型(升):可交互能力实现跃迁,通数字孪生与具身智能底层底座;
Mureka v9.5(升):AI 音乐创作走向量产落地;
机器人模型 Riemann-1.0(发):通世界模型与实体机器人交互闭环。
看出门道了吗?前两个管数字世界的生成,三个开始伸手碰真实世界。
尤其是世界模型这块底座,头连着游戏和;另头,次连上了实体机器人。
数字满,下张落在物理世界,水到渠成。
两条线在这里交汇,就有了黎曼动力。
至于为什么单成立公司?昆仑万维的逻辑并不复杂:
机器人这种硬核赛道没有速胜,得让核心团队立发展、配上属资源、做长期投入。
母公司出力、出生态,团队心跑技术,各展所长。
套动作下来,昆仑万维,这几年前就把「实现 AGI」写进公司使命的玩,次真正把手伸进了物理世界。
AGI 的上半场在屏幕里,下半场,在屏幕外。
向已明,剩下的,就看谁跑得快了。
键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见相关词条:储罐保温 异型材设备 钢绞线厂家 玻璃丝棉厂家 万能胶厂家
奥力斯 PVC管道管件粘结胶价格 联系人:王经理 手机:18231788377(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区/p>
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述临汾家具封边胶厂,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。