生数科技认领神秘登顶模型：AI视频公司拿出工业级Demo，跨本体跑通复杂长程任务

区别于传统的专用机器人大脑，这个“大脑”既具备世界模型的预测推演能力，又能输出行动指令，真正做到“知行合一”。

大脑模型名叫MotuBrain，4月中旬悄悄登顶两个国际benchmark，却无人知晓来历，让具身圈大佬们猜了三周。

两个国际benchmark，一个测试“能不能看懂物理世界”，一个考验“能不能真的动手干活”。

就像一个人一边参加物理竞赛，一边考叉车实操证，4月中旬，MotuBrain两门都拿了全场最高分。

实际内里也是大有乾坤：具身智能的未来需要World Action Model（世界动作模型），而后者必须建立在视频模型对物理世界的理解之上。

MotuBrain悄无声息地同时登顶WorldArena和RoboTwin2.0，不少具身大佬都被这个神秘模型勾起好奇心，疯狂打听到底是谁家做的。

2025年12月，生数科技正式开源通用基座世界模型Motus，这是其在物理世界智能方向的一次试水。

MotuBrain作为全面升级的商业模型版本，继承了Motus完整核心技术架构，并完成关键能力突破。

验证实力的第一站：WorldArena。这是业界公认的World Model能力测试场。

一个物体被推一下会朝哪个方向运动？两个物体碰撞后会发生什么？连续动作的轨迹是否平滑、是否符合真实物理规律？

EWM Score是这个榜单的综合评分，Motion Quality、Flow Score、Motion Smoothness这些维度分别考察动作的真实性、连续性和平滑度。

它给模型设置了50个不同的任务，覆盖抓取、放置、推、拉、旋转等多种操作类型，还分两种环境进行测试：

二是Randomized场景，会引入随机的扰动，比如物体位置随机偏移，灯光颜色随机变化，甚至桌子角度都可能微调。这考验的是模型能不能泛化到没见过的条件。

拆开50个具体任务看，MotuBrain九成任务超过90分，一半任务更是拿到了满分100分。这已经不是领先了，这叫断崖式领先。

从榜单成绩看，MotuBrain拥有更接近通用机器人大脑的能力特征，它不是单项任务的“偶然强”，而是跨任务、跨场景的泛化能力都强。

从生数科技发布的Demo看，没有复杂的上层VLM加持，也没有预设动作脚本，却将MotuBrain的4个核心能力完整呈现，看完只剩震撼！

这段不足3分钟视频，用3台不同型号的仿人形机器人，演示了5种任务：插花、整理沙发、服务一场火锅局、调酒、整理洗漱台。

没错，MotuBrain的第一个能力就是一脑多型，它不是为某一种机器人量身定制，而是面向多机器人本体设计的统一智能底座。

它在不同形态、不同自由度、不同传感器的机器人上都能跑，而且接入的机器人种类越多，数据和场景越丰富，模型表现越好。

插花、整理沙发，别看在这几项任务里算“简单”的，恰恰是最考验长程任务建模能力的操作。

我们能看到，机器人精准抓取三支花，分别稳稳插入花瓶后，顺势拿起浇水壶，对着花枝均匀喷洒清水，整个过程非常丝滑，没有停顿。

也能看到它精准识别出散落的衣物和错位的靠枕，先将衣物逐一拾起、规整放入洗衣篮，再将歪歪扭扭的靠枕摆回原位。

不同于传统机器人仅能完成2-3个原子动作的Demo展示，MotuBrain的一个World Action Model可完成10个原子动作级别的复杂长程任务。

无论是插花还是整理沙发，机器人面对的不再是一个个孤立动作，而是一项需要持续推进的完整任务。

最让人眼前一亮的，当属服务一场火锅局。机器人被要求从锅中舀取一份丸子放入碗中，同时倒一杯果汁。

一个小细节是，起初勺子放在锅里，机器人用左手握住勺柄，没有立刻捞取，而是先判断了一下漏勺中有没有物体，然后重新伸向锅中舀取丸子，盛入面前的碗中。

别小瞧这个不起眼的动作，需要机器人「理解」勺子是空的，同时能自主「预测」并重新执行捞取动作。

多数机器人是“看到什么就做什么”。而在这个取丸子场景里，如果换成传统指令式机器人，它只会按脚本执行“舀→放”的动作。

但MotuBrain能做到：像人一样“察言观色”，握住勺柄的瞬间就通过视觉判断出“勺里没东西”，紧接着自主规划新路径，重新伸回锅中精准舀取丸子。

直到确认勺子里有食材，它再稳稳端起，送入碗中，全程行云流水，无需人工干预或重新下指令。

理解世界、预测变化，并据此驱动更合理的行动，这就是MotuBrain的一脑预见能力。

只见「硅基调酒师」右手拿起饮料，精准倒入盎司杯中定容，放下饮料瓶后，左手迅速拿起牛奶瓶，将牛奶缓缓注入中间的玻璃空杯，动作轻柔且精准，全程没有一滴洒漏。

待牛奶倒完，右手再次拿起盎司杯，将里面的饮料缓缓倒入牛奶杯中，最后还不忘取一片薄荷叶，轻轻放在饮品表面做点缀。

完成造型后，它还俏皮地捏了一下身边的塑料小黄鸭，仿佛在向围观者“报喜”：鸡尾酒做好啦！

相比于传统做法，比如搬箱子用一个模型、开门用一个，叠衣服又一个……任务越多越臃肿。

这样做的好处是，随着任务数量持续增加，任务之间的共享世界知识越多，MotuBrain的平均任务成功率也会同步提升。

这四个能力叠在一起，MotuBrain就有了为连续、智能、真实世界的行动而设计的机器人通用大脑。

过去一年，围绕World Model和Action Model，行业已逐步形成几条有代表性的技术路线：

二是先看后动派，先训练一个视频预测模型用来想象未来，再把想象的结果作为决策依据。听起来有点像人类先在大脑里模拟一遍再动手。

MotuBrain走的是第三条路线——边看边动派，也就是World Action Model。

它把推演和行动融合在同一个模型里，没有先后顺序，决策的同时就在推演，推演的结果直接影响决策。

它不需要等待机器人“想象”后再行动，响应速度更快；同时因为推演和行动共享同一个表征空间，预测的偏差和执行的偏差不会相互放大。

你看到前车刹车灯亮起的那一刹那，大脑已经在预测“0.5秒后我离前车还有多远”“现在踩刹车重了会不会追尾”“轻了会不会刹不住”。

传统AI模型更像是“观看者”或“分析者”，给它一张小猫的图片，它能认出来；给它一段视频，它能描述发生了什么。

MotuBrain要解决的，也不是“机器人会不会做一个动作”，而是“机器人能不能连续完成一个任务”。

而想要做到这点，要求机器人必须真正理解真实世界中的运动和物理变化。它的行动必须是连续的、能适应变化的、可以跨本体、跨任务的。

在WorldArena评测中，MotuBrain在三个与“运动”直接相关的维度上全部拿下第一：

从技术层面看，MotuBrain的设计并不复杂，却很有章法。每一步都像在给机器人“换脑子、塑认知”。

其技术根基源自Motus在去年12月确立的World Action Models。

核心思路很简单：先给机器人的“视觉”（视频）和“动作”（机械运动）做一套“统一翻译系统”，彻底打通多模态信息壁垒。

而且，相比传统VLA只能吃特定本体上的纯任务数据，Motus「不忌口」，能同时消化各种数据（纯视频、无标签数据、机器人运动轨迹）。

从左图可以看出，随着任务数量增加，Pi-0.5成功率持续下降，而MotuBrain成功率持续上升。

此外，任务数量的scaling law曲线比数据量更为陡峭，说明对于MotuBrain这种数据效率极高的模型来说，相比于增加数据量，增加任务的多样性对成功率的提升效果更为显著。

真机演示里，我们也能看出来，该模型已在多款仿人形机器人上验证过，大模型运行不卡顿，不用额外辅助工具，仅凭自身能力，就能高成功率完成长程任务，还能左右手同时做不同事。

总结下来，MotuBrain真正厉害之处，不在于多复杂的技术堆砌，而在于用“统一建模”打通了机器人的“感知、理解、行动”，让机器人真正从“机械执行”，走向“智能决策”。

这不是一笔小钱，投资机构看中的不是“又一家做视频模型的公司”，而是一个更大的叙事：打通数字世界与物理世界的通用世界模型。

这个架构也是该公司整个战略的技术基座，它做的事情很底层，也很关键：统一处理视觉、听觉、触觉等多模态信息。

不同类型的感知数据被塞进同一个模型框架里训练，模型逐渐建立起对世界的统一认知：什么是物体，什么是运动，什么是因果关系。

就像人类婴儿的大脑，不是分别长出一个视觉皮层和一个运动皮层，而是两者协同发育、互相促进。

先看第一条路，生数科技走的是世界生成模型（WGM）路线，产品就是大家熟悉的视频大模型Vidu。

Vidu的能力不只是在给定提示词后生成一段好看的视频。在生成视频的过程中，模型必须学会物理规律：水怎么流、光怎么反射、物体怎么碰撞。

它已经在商业化上证明了这一点：漫威《毒液3》的水墨风格宣传片，完全基于Vidu生成；AI漫剧《明日周一》10人团队45天产出50集，上线5天播放量破500万。

Vidu和MotuBrain，一个是数字空间的产出，一个是物理空间的执行，两套产品，同一条根。

绝大多数做机器人大脑的公司没有视频大模型的基础，数据来源主要是仿真环境和真实机器人采集的数据，成本高、规模小。

而绝大多数做视频模型的公司没有机器人动作数据的积累，输出可以很美，但无法驱动实体。

当然，光有数据还不够，模型层面的突破还需要场景验证。目前，生数科技已经与无界动力、深朴智能、星尘智能达成战略合作。

这些合作伙伴有的主攻工业制造与商业服务场景，有些瞄准类家庭商业场景与合作住宿场景。

合作内容不只是“把MotuBrain装上去试试”，而是技术层面的联合优化、数据层面的双向飞轮、应用层面的规模化落地。

具身智能行业的共识变了，大家已经不在意谁造出更灵巧的机器人，更关心谁先做出真正通用的机器人大脑。

他们争夺的不是一两个爆款应用，而是下一代的操作系统入口，甚至更底层——通用物理世界的入口。

这个节骨眼上，刚完成近20亿元B轮融资的生数科技，带着双榜第一的MotuBrain出现了。

当别人还在纠结该走World Model还是VLA时，生数科技用同一个模型同时做到了行业第一。

官网链接： https://www.shengshu.com/zh/motubrain