资讯

WRC最忙机器人:猛干15分钟家务,收纳、补货、叠衣服…

📅 2026-08-21 · AI导航编辑部
WRC最忙机器人:猛干15分钟家务,收纳、补货、叠衣服… 墨奇,开始加速了 Jay 发自 凹非寺 量子位 | 公众号 QbitAI 世界模型和VLA,都不是答案。 这个观点,出自前华为智驾AI一号位、「华为天才少年」黄青虬。 离开华为后,他

墨奇,开始加速了

Jay 发自 凹非寺 · 量子位 | 公众号 QbitAI

世界模型和VLA,都不是答案。

这个观点,出自前华为智驾AI一号位、「华为天才少年」黄青虬。

离开华为后,他联合创办了通用具身智能公司墨奇智能——成立仅半年,估值已超70亿元。

近期,墨奇迎来第一次交卷:自研具身智能模型架构MoRA(MORPHI Reasoning & Autonomy)——一条Agentic-Native的具身大脑路线。

WRC 2026现场,墨奇正式展示了这个大脑的能力。

承载这个大脑的,是墨奇自研的本体——

MORPHI KINO,一台面向家庭服务场景的轮式机器人。

这也是其本体的首次公开亮相。

现场,这台机器人用15分钟,完成了一个完整的家居长程任务:

清理桌面垃圾、检查冰箱库存并补货、将湿衣送入烘干机并启动,再拿出来叠好码放……

整个过程一气呵成,全程无需人工指挥。

对人类来说,这是六岁小朋友都能做完的家务,大家可能会觉得没啥可说的。

但对机器人而言,任何任务一旦沾上「长程」二字,基本就是死路一条。现阶段敢展示5分钟以上的,都算非常自信了。

更别提还是泛化性要求拉满的家庭场景。

而墨奇这次在WRC现场,直接硬生生干了15分钟家务……

可以说是非常独树一帜了。早上刚开馆不久,墨奇的展台就已经围得水泄不通,甚至工作人员自己都有点惊讶:

根本没想到会有这么多人。

所以,墨奇究竟是怎么做到的?

Agent原生的具身大脑

回答这个问题前,先得看看传统方案是怎么做的。

目前为了解决「长程」,Agent方案基本已成共识了:Google Gemini Robotics、Figure Helix 02……等等。

核心就是分层架构,也就是老生常谈的System 1与System 2。

System 2:机器人大脑。

由大语言模型或视觉语言模型担任,负责理解目标、拆解任务、验证结果;

System 1:策略模型。

接收子任务指令后,结合视觉和本体状态执行动作。

这套架构让机器人初步具备了完成长程任务的能力,是具身行业的一次大突破,也出现了不少有趣的demo。

但问题也很明显——

全靠System 2在Carry啊。。。

任务的主体智能——目标维护、记忆管理、进度追踪、失败恢复——几乎全部压在System 2认知层。

而直接和物理世界打交道、持续输出动作的System 1,则彻底「瘫坐」,沦为一个只会机械执行子任务的傻瓜机器。

这会带来两个问题。

1、目标接口有限。

传统动作模型只能接收固定格式的文本子任务指令,不支持图像指令,也处理不了多阶段的结构化任务描述。

System 2只能不断把高层目标拆碎、格式化,再喂给System 1。

这个过程中,每转译一层,信息就损耗一层。

到最后,最初的目标定义已经稀碎了——System 1根本不知道「目标」这俩字是啥意思,眼里只有下一个Action。

2、执行以短时序、反应式为主。

这应该也是大家普遍存在的疑惑——

机器人动作慢也就算了,为啥总一卡一卡的??

根源就在于System 1的技能点太少了。

模型既没有对任务整体进度的认知,也没有多粒度执行记忆。遇到环境扰动或者中途偏差,System 1自己不会纠错,只能停下来等System 2重新调度。

结果就是:频繁停顿,重新规划,再次启动。

这在强调「实时+闭环」的具身语境下当然是不行的。真实物理世界充满不确定性,要是每走一步都等大脑发号施令,那黄花菜都凉了……

这也是墨奇提出MoRA的原因。

与业界常见的「大模型外挂动作策略」方案不同,墨奇主张让Agentic能力原生存在于策略模型内部,把目标持续性、执行记忆和任务进展变成System 1的原生能力。

这样,机器人才能从「输出下一个动作」转向「持续工作」。

具体而言,MoRA的System 1具备三项核心能力。

1、目标为条件的持续执行。

目标得在输入时就定义好。

MoRA接收的是由文本和图像共同定义的结构化任务目标,不是离散的动作指令。

同时,目标接口原生内化进策略模型,指令和动作之间无需层层转译。

机器人从接收到目标的那一刻起,就知道自己要做到什么状态才算完成。

2、多层级记忆。

这是执行过程中内置的进度条。

长程任务的本质挑战是时间跨度,模型要同时记住:刚刚做了什么、做到哪一步了、整体进展如何。

为此,MoRA在System 1内部构建了三层记忆——

- 短期:处理毫秒级的控制连续性;

- 中期:管理步骤级的执行状态;

- 长期:保留任务整体的目标与进度。

这些进度记忆,会成为模型表征空间的一部分。

3、进度认知的闭环。

最终就是将这些能力在输出阶段打通了。

MoRA在输出动作的同时,会结合目标、执行记忆和环境反馈,持续判断任务状态与当前进展,并在必要时反馈给System 2使其介入。

有了这些上下文,大部分中途偏差,System 1自己就能感知并修正,不必事事上报。

最终,MoRA的双系统,变成了这样——

System 2化身「项目经理」:

专注意图理解、全局规划与异常兜底,并通过多模态交互与人协同;

System 1,晋升「主力员工」:

明确目标后不间断输出全身动作,自主维护记忆、追踪进度,仅在遇到能力边界时主动请求介入。

双剑合璧。

亮相WRC 2026:15分钟长程任务实录

纸上谈来终觉浅,这套架构在真实场景中到底表现如何?

WRC 2026的现场,墨奇给出了答案。

这是公司自成立以来第一次亮相大型展会,一同公布的,还有他们的自研本体——MORPHI KINO轮式机器人。

长得也是挺萌的,还有不同表情,可以换着DIY。

它的主秀,是一个家居长程任务。

真的很长,整整15分钟啊……

我尽量还原一下现场,讲几处比较有意思的点。

任务一:桌面整理。

机器人导航到垃圾桶处,拿起垃圾桶一路溜达到茶几,把茶几上的纸巾、空矿泉水瓶丢进去,再把垃圾桶送回原位。

这主要考验的是模型的通用Picking能力。

任务二:冰箱补货。

机器人走向水吧台,伸手拉开了冰箱门。

开门这个动作,对机器人来说其实很有挑战性。

门把手的位置、门的开合方向……都需要实时感知和调整,还要考虑躯干的站位,不能把门堵住。

但真正有意思的在后面。

门开之后,KINO探头看了看冰箱内部,停顿了两三秒。

这是在干啥???

检查库存。

是的,就像酒店的客房服务人员,每天检查冰箱里的矿泉水数量,不够就要补上。

然后大的来了。

检查完毕,KINO直起身,转身走向房间里的另一张小桌子,取了一瓶矿泉水!!!

然后回来放进了冰箱里。

任务三:衣物洗烘与折叠。

机器人前往洗衣房,拉开烘干机门,取出一件已经烘干的T恤。

然后,它走到叠衣桌旁……

把这件干T恤直接放进了净衣篓???

是的,根本没有叠,仿佛下定了某种决心般,径直走向了洗衣机。

说实话,当时真没太看懂,我还以为是出事故了。

听主持小哥讲解才知道,洗衣机里还有件湿衣,KINO是要去把它拿出来烘干,趁等待的时间再回来叠衣服——这样能最大程度节省时间。

这就是我前面说的进度认知。有了这项原生天赋点,在真实场景下,其实能泛化出很多玩法。

差不多就是这些。

说实话,清理桌面、检查库存、洗烘衣物,单拎出任何一个都不算惊天动地。

但能靠一套模型把这串任务自主串起来,就很恐怖了。

工作人员说,只是一些简单的目标Prompt:

打扫这个房间,收拾桌面,把水放到冰箱,然后把洗烘衣服处理一下。

剩下的步骤全是MoRA内部配合完成。

对了,除了主秀,展台上还有三道小菜。

1、Pick and Place。

桌上摆了一箩筐东西,玩偶、眼镜盒、饮料瓶……摆放位置和朝向完全随机,KINO会从最右手边的第一个开始,一个个抓起来收纳好。

你也可以自带考题过去,我拿的是喝了一半的矿泉水瓶。

这个过程中,观众可以随意干扰,模型会实时闭环调整。

但玩得最开心的还是展台小哥,属于是沉浸于自己的艺术无法自拔了——

KINO刚收纳完一个,他就又扔回去一个,一人一机搁这儿Loop是吧。

(bushi)

让我印象比较深刻的是,墨奇这个Pick and Place的抓取频率非常高,策略模型输出挺丝滑,没有动一下卡一下的情况。

2、递盲盒。

观众在屏幕上选盲盒,任务编排器将信号转为目标Prompt,机器人识别Prompt,找到对应颜色的包装盒,装进帆布袋,递给观众。

最后,还有个留影合照环节。

观众用磁铁表情件给机器人拼脸,然后跟它合影,机器人会摆pose——比耶、挥手、叉腰。

这个主要就是提供情绪价值了,也和他们进家庭的气质比较匹配吧。

质量,远比数量重要

当然,在这些demo背后,除了模型之外,还有一条更加重要的暗线——

数据。

这也是墨奇让我印象比较深刻的地方。

数据已经是具身行业公认的最大瓶颈。今年以来,大家集体开启攻坚战,每家公司都在宣布千万小时、1亿小时的具身数据计划。

但就在同行全力踩油门、重金堆数据量的时刻,墨奇的判断却是:

真实场景的数据质量,远比数量重要。

在墨奇CTO黄青虬看来,模型的本质是信息压缩、模态转换。LLM是语言到语言,具身是语言or视频到Action。

但二者的解题方式不太一样。

LLM天赋点拉满了,互联网数据一股脑丢进去就是,质量无所谓,反正参数大了之后,模型能自己过滤噪音。

但具身没法这样暴力解题。

物理世界要求「实时+闭环」,必须端侧部署,模型参数一大,基本宣告与落地无缘。

因此,具身必须在有限参数下,尽可能多地消化数据。

这也是墨奇如此重视数据质量的原因。

现场,墨奇工作人员无奈地表示,这很大程度上也是被倒逼出来的。

当时也采购了很多数据,拿回来才发现根本没法用。

这也让他们从第一天起就坚定了做好Infra,稳扎稳打慢慢攒高质量数据的决心。

也是蛮有魄力的一个bet了,同行都在疯狂采数据,但我现场跟展台小哥们聊了聊,感觉墨奇似乎没有特别FOMO,也不会强调年底一定要采多少数据啥的。

接下来就深入看看墨奇选择的数采思路吧。

墨奇表示,他们走的是一条优化过的无本体采集路线。

以人类第一视角数据为起点,通过统一具身动作空间对齐人类行为与机器人动作,把真实作业中与本体无关的任务知识映射给机器人。

这也是这两年行业的主流选择。比纯仿真Gap小,也比遥操容易Scaling得多。

但缺点嘛,就是精度还是不太够——

这也是墨奇重点优化的方向。

首先,采集设备是自研的。

这也是现阶段的行业共识:前沿公司基本都追求数据、软件、硬件一体,所有板块相互耦合,最大程度推进迭代速度。

数采,则是这套系统中最重要的一环。事实上,只要数据足够好,模型层的很多问题都会迎刃而解。

墨奇的数采设备叫MORPHI Sense Kit,能在弱纹理、高反光这类极端场景下做到毫米级轨迹重建。

其次,采集场景是真实的。

今年上海WAIC上,具身的核心主题就是场景导向:大家纷纷开始与场景方合作,探索特定场景的梯度下降,在落地中找数据。

墨奇也是这么做的,但路线不太一样——没做工业,优先进的是服务行业,他们把这视为进家庭的抓手。

数采设备直接进入酒店、商务公寓等一线商业场景,由真正的作业人员在日常工作中产出数据。

最后,就是一套能消化大规模数据的Infra。

这也是过去半年墨奇主要在做的事。

可能也和公司基因有关——CTO黄青虬之前在华为做量产,对工程抓得很细,每个模块都要反复打磨。

如今也是正式启动了,墨奇已积累3万小时真实场景数据,计划2026年底完成15万至20万小时的数据储备。

马拉松,刚刚开始

过去几年,行业花了大力气,让机器人从能够运动,走向能够操作;从单项技能,走向多技能组合。

但下一个阶段的考题,似乎正在发生变化——

长程为王。

机器人得在充满变化的真实环境里,把一项任务从开始持续推进到完成。

这也是墨奇的入场姿势:Agentic-Native——

把目标、记忆与进度这些与长程任务息息相关的能力,变成策略模型的原生天赋点。

不过,这家公司自出水后,也一直在听到一类质疑的声音:

具身创业都三年半了,这个点才入局,会不会太晚?

对此,他们的回应是:

具身是一场马拉松。

这是黄青虬的判断,也是墨奇这家公司的节奏。

不追世界模型的热度,不贴VLA的标签,一心把Agentic能力做成模型的原生能力,在真实场景里慢慢搭建数据Infra。

起步落后几个身位没关系,毕竟,马拉松,从来不看前一百米。

2026年,具身回归场景导向,长程任务成为新赛段的新主题——

墨奇,开始加速了。

- 深度体验DeepSeek Harness,我原谅它涨价了2026-08-14

- 刚刚,DeepSeek V4 Pro正式版发布,多项对标Fable 52026-08-13

- 刚刚,Manus恢复独立运营2026-08-12

- Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字2026-08-11

来源:https://www.qbitai.com/2026/08/476413.html