区别于传统的专用机器人大脑,这个“大脑”既具备世界模型的预测推演能力,又能输出行动指令,真正做到“知行合一”。
大脑模型名叫MotuBrain,4月中旬悄悄登顶两个国际benchmark,却无人知晓来历,让具身圈大佬们猜了三周。
两个国际benchmark,一个测试“能不能看懂物理世界”,一个考验“能不能真的动手干活”。
就像一个人一边参加物理竞赛,一边考叉车实操证,4月中旬,MotuBrain两门都拿了全场最高分。
实际内里也是大有乾坤:具身智能的未来需要World Action Model(世界动作模型),而后者必须建立在视频模型对物理世界的理解之上。
MotuBrain悄无声息地同时登顶WorldArena和RoboTwin2.0,不少具身大佬都被这个神秘模型勾起好奇心,疯狂打听到底是谁家做的。
2025年12月,生数科技正式开源通用基座世界模型Motus,这是其在物理世界智能方向的一次试水。
MotuBrain作为全面升级的商业模型版本,继承了Motus完整核心技术架构,并完成关键能力突破。
验证实力的第一站:WorldArena。这是业界公认的World Model能力测试场。
一个物体被推一下会朝哪个方向运动?两个物体碰撞后会发生什么?连续动作的轨迹是否平滑、是否符合真实物理规律?
EWM Score是这个榜单的综合评分,Motion Quality、Flow Score、Motion Smoothness这些维度分别考察动作的真实性、连续性和平滑度。
它给模型设置了50个不同的任务,覆盖抓取、放置、推、拉、旋转等多种操作类型,还分两种环境进行测试:
二是Randomized场景,会引入随机的扰动,比如物体位置随机偏移,灯光颜色随机变化,甚至桌子角度都可能微调。这考验的是模型能不能泛化到没见过的条件。
拆开50个具体任务看,MotuBrain九成任务超过90分,一半任务更是拿到了满分100分。这已经不是领先了,这叫断崖式领先。
从榜单成绩看,MotuBrain拥有更接近通用机器人大脑的能力特征,它不是单项任务的“偶然强”,而是跨任务、跨场景的泛化能力都强。
从生数科技发布的Demo看,没有复杂的上层VLM加持,也没有预设动作脚本,却将MotuBrain的4个核心能力完整呈现,看完只剩震撼!
这段不足3分钟视频,用3台不同型号的仿人形机器人,演示了5种任务:插花、整理沙发、服务一场火锅局、调酒、整理洗漱台。
没错,MotuBrain的第一个能力就是一脑多型,它不是为某一种机器人量身定制,而是面向多机器人本体设计的统一智能底座。
它在不同形态、不同自由度、不同传感器的机器人上都能跑,而且接入的机器人种类越多,数据和场景越丰富,模型表现越好。
插花、整理沙发,别看在这几项任务里算“简单”的,恰恰是最考验长程任务建模能力的操作。
我们能看到,机器人精准抓取三支花,分别稳稳插入花瓶后,顺势拿起浇水壶,对着花枝均匀喷洒清水,整个过程非常丝滑,没有停顿。
也能看到它精准识别出散落的衣物和错位的靠枕,先将衣物逐一拾起、规整放入洗衣篮,再将歪歪扭扭的靠枕摆回原位。
不同于传统机器人仅能完成2-3个原子动作的Demo展示,MotuBrain的一个World Action Model可完成10个原子动作级别的复杂长程任务。
无论是插花还是整理沙发,机器人面对的不再是一个个孤立动作,而是一项需要持续推进的完整任务。
最让人眼前一亮的,当属服务一场火锅局。机器人被要求从锅中舀取一份丸子放入碗中,同时倒一杯果汁。
一个小细节是,起初勺子放在锅里,机器人用左手握住勺柄,没有立刻捞取,而是先判断了一下漏勺中有没有物体,然后重新伸向锅中舀取丸子,盛入面前的碗中。
别小瞧这个不起眼的动作,需要机器人「理解」勺子是空的,同时能自主「预测」并重新执行捞取动作。
多数机器人是“看到什么就做什么”。而在这个取丸子场景里,如果换成传统指令式机器人,它只会按脚本执行“舀→放”的动作。
但MotuBrain能做到:像人一样“察言观色”,握住勺柄的瞬间就通过视觉判断出“勺里没东西”,紧接着自主规划新路径,重新伸回锅中精准舀取丸子。
直到确认勺子里有食材,它再稳稳端起,送入碗中,全程行云流水,无需人工干预或重新下指令。
理解世界、预测变化,并据此驱动更合理的行动,这就是MotuBrain的一脑预见能力。
只见「硅基调酒师」右手拿起饮料,精准倒入盎司杯中定容,放下饮料瓶后,左手迅速拿起牛奶瓶,将牛奶缓缓注入中间的玻璃空杯,动作轻柔且精准,全程没有一滴洒漏。
待牛奶倒完,右手再次拿起盎司杯,将里面的饮料缓缓倒入牛奶杯中,最后还不忘取一片薄荷叶,轻轻放在饮品表面做点缀。
完成造型后,它还俏皮地捏了一下身边的塑料小黄鸭,仿佛在向围观者“报喜”:鸡尾酒做好啦!
相比于传统做法,比如搬箱子用一个模型、开门用一个,叠衣服又一个……任务越多越臃肿。
这样做的好处是,随着任务数量持续增加,任务之间的共享世界知识越多,MotuBrain的平均任务成功率也会同步提升。
这四个能力叠在一起,MotuBrain就有了为连续、智能、真实世界的行动而设计的机器人通用大脑。
过去一年,围绕World Model和Action Model,行业已逐步形成几条有代表性的技术路线:
二是先看后动派,先训练一个视频预测模型用来想象未来,再把想象的结果作为决策依据。听起来有点像人类先在大脑里模拟一遍再动手。
MotuBrain走的是第三条路线——边看边动派,也就是World Action Model。
它把推演和行动融合在同一个模型里,没有先后顺序,决策的同时就在推演,推演的结果直接影响决策。
它不需要等待机器人“想象”后再行动,响应速度更快;同时因为推演和行动共享同一个表征空间,预测的偏差和执行的偏差不会相互放大。
你看到前车刹车灯亮起的那一刹那,大脑已经在预测“0.5秒后我离前车还有多远”“现在踩刹车重了会不会追尾”“轻了会不会刹不住”。
传统AI模型更像是“观看者”或“分析者”,给它一张小猫的图片,它能认出来;给它一段视频,它能描述发生了什么。
MotuBrain要解决的,也不是“机器人会不会做一个动作”,而是“机器人能不能连续完成一个任务”。
而想要做到这点,要求机器人必须真正理解真实世界中的运动和物理变化。它的行动必须是连续的、能适应变化的、可以跨本体、跨任务的。
在WorldArena评测中,MotuBrain在三个与“运动”直接相关的维度上全部拿下第一:
从技术层面看,MotuBrain的设计并不复杂,却很有章法。每一步都像在给机器人“换脑子、塑认知”。
其技术根基源自Motus在去年12月确立的World Action Models。
核心思路很简单:先给机器人的“视觉”(视频)和“动作”(机械运动)做一套“统一翻译系统”,彻底打通多模态信息壁垒。
而且,相比传统VLA只能吃特定本体上的纯任务数据,Motus「不忌口」,能同时消化各种数据(纯视频、无标签数据、机器人运动轨迹)。
从左图可以看出,随着任务数量增加,Pi-0.5成功率持续下降,而MotuBrain成功率持续上升。
此外,任务数量的scaling law曲线比数据量更为陡峭,说明对于MotuBrain这种数据效率极高的模型来说,相比于增加数据量,增加任务的多样性对成功率的提升效果更为显著。
真机演示里,我们也能看出来,该模型已在多款仿人形机器人上验证过,大模型运行不卡顿,不用额外辅助工具,仅凭自身能力,就能高成功率完成长程任务,还能左右手同时做不同事。
总结下来,MotuBrain真正厉害之处,不在于多复杂的技术堆砌,而在于用“统一建模”打通了机器人的“感知、理解、行动”,让机器人真正从“机械执行”,走向“智能决策”。
这不是一笔小钱,投资机构看中的不是“又一家做视频模型的公司”,而是一个更大的叙事:打通数字世界与物理世界的通用世界模型。
这个架构也是该公司整个战略的技术基座,它做的事情很底层,也很关键:统一处理视觉、听觉、触觉等多模态信息。
不同类型的感知数据被塞进同一个模型框架里训练,模型逐渐建立起对世界的统一认知:什么是物体,什么是运动,什么是因果关系。
就像人类婴儿的大脑,不是分别长出一个视觉皮层和一个运动皮层,而是两者协同发育、互相促进。
先看第一条路,生数科技走的是世界生成模型(WGM)路线,产品就是大家熟悉的视频大模型Vidu。
Vidu的能力不只是在给定提示词后生成一段好看的视频。在生成视频的过程中,模型必须学会物理规律:水怎么流、光怎么反射、物体怎么碰撞。
它已经在商业化上证明了这一点:漫威《毒液3》的水墨风格宣传片,完全基于Vidu生成;AI漫剧《明日周一》10人团队45天产出50集,上线5天播放量破500万。
Vidu和MotuBrain,一个是数字空间的产出,一个是物理空间的执行,两套产品,同一条根。
绝大多数做机器人大脑的公司没有视频大模型的基础,数据来源主要是仿真环境和真实机器人采集的数据,成本高、规模小。
而绝大多数做视频模型的公司没有机器人动作数据的积累,输出可以很美,但无法驱动实体。
当然,光有数据还不够,模型层面的突破还需要场景验证。目前,生数科技已经与无界动力、深朴智能、星尘智能达成战略合作。
这些合作伙伴有的主攻工业制造与商业服务场景,有些瞄准类家庭商业场景与合作住宿场景。
合作内容不只是“把MotuBrain装上去试试”,而是技术层面的联合优化、数据层面的双向飞轮、应用层面的规模化落地。
具身智能行业的共识变了,大家已经不在意谁造出更灵巧的机器人,更关心谁先做出真正通用的机器人大脑。
他们争夺的不是一两个爆款应用,而是下一代的操作系统入口,甚至更底层——通用物理世界的入口。
这个节骨眼上,刚完成近20亿元B轮融资的生数科技,带着双榜第一的MotuBrain出现了。
当别人还在纠结该走World Model还是VLA时,生数科技用同一个模型同时做到了行业第一。
官网链接: https://www.shengshu.com/zh/motubrain
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1