光合及目
1lux.xyz
← 报道
行业报道exa-topic-search· 2026-09-21

具身“大脑”之争,不是淘汰赛

当前,具身智能赛道正经历清晰的产业重心上移:早期行业竞争主要集中在本体硬件、运动性能层面,如今正加速进入具身“大脑”的技术与商业化较量阶段。

与之伴随的是,“大脑”技术公司密集获投、估值持续攀升,新创业主体持续涌入,技术路线的讨论也从“有没有”转向“谁更优”。

其中,世界模型凭借环境预判能力,以及被业界寄予厚望的因果推演潜力快速崛起,成为行业焦点,也让此前支撑绝大多数落地场景的VLA陷入定位争议,甚至出现了“VLA已死”的激进论调。

那么,世界模型的爆火,真的意味着VLA已经过时了吗?被寄予通用化厚望的世界模型,又是否真的是具身智能的终极答案?

带着这些问题,在近日盖世集团主办的“2026具身感知融合与多模态大模型创新研讨会”上,来自产业链上下游的多位嘉宾展开了讨论。大家给出的观点虽然不完全一致,却共同勾勒出了当下具身“大脑”真实的产业坐标。

图片来源:盖世具身智能

从VLA到世界模型

具身“大脑”的技术路线,正从过去两年的VLA占据主导,走向多路线并行。

所谓VLA(视觉-语言-动作模型),即以摄像头图像等多模态观测和自然语言指令为输入,直接输出机器人可执行的动作,把“看懂场景—听懂指令—做出动作”端到端学进一个神经网络。

这一路线的本质是数据驱动的端到端策略,属于模仿学习:从大量演示里学“观测—动作”的映射。

换言之,VLA就像是一个“看到什么、听到什么,就条件反射般动手”的反应式操作员,学的是“这种情况下专家会怎么做”。

由于架构内部少了模块的拼接,VLA的优势很明显:链路短、响应快,对于端侧部署更友好。比如优必选Thinker-VLA,就是主打端侧运行,降低端侧推理成本。

“但VLA也有自己的问题:VLA生成的主要是动作序列,缺乏对物理约束的感知,以及对下一时刻的预测。”睿尔曼智能科技(北京)股份有限公司解决方案总监计海锋指出。

这意味着,VLA固然能回答“动作如何稳定执行”,却不擅长回答“动作之后环境如何演化”,特别是缺乏长程规划与因果推理能力,分布外泛化性弱。

而这,恰好是世界模型的先天优势:给定当前状态和一个候选动作,预测世界接下来会发生什么变化,回答“这么做之后会怎样”,并基于这一思考完成与物理世界的交互。

那么,“预测世界”和 “决定动作”具体如何实现?极佳视界给出的答案是:世界生成模型与世界行动模型。

“世界生成模型,是给定一个动作后,预测世界将会发生什么样的变化;世界行动模型的输入输出正好反过来,是给定当前观测,预测接下来应当采取什么样的动作。因此,生成模型和行动模型恰好可形成配对,二者共同构成一个完整闭环。”极佳科技合伙人&副总裁毛继明表示。

极佳视界是世界模型路线的坚定实践者。正是基于这一逻辑,目前极佳视界已经建立了“世界生成模型”与“世界动作模型”两大技术体系,其中“世界生成模型”包括面向具身智能的GigaWorld、面向自动驾驶的DriveDreamer以及面向内容创作的一粟YiSu;“世界动作模型”包括通用具身大脑GigaBrain和世界动作模型GigaWorld-Policy。

不过,尽管已经在世界模型领域取得了一系列成果,毛继明认为,当前这一技术路线仍处于发展初期。

图片来源:极佳视界

此前,在2026世界机器人大会上,极佳视界首次提出通用世界模型L1-L5分级体系:

L1:根据各种输入生成视觉真实的通用视频世界,先让世界“看起来真实”;

L2:生成高效、合理的通用执行动作,实现从“看见未来”到“做出选择”;

L3:生成几何准确的通用空间世界,让世界从像素表面获得几何信息;

L4:生成物理精确的通用物理世界,从空间正确走向因果正确;

L5:生成可长程运营的通用无限世界,让一个世界长期存在、持续反馈。

“其中L1和L2,对应的是GPT-3时刻的状态;进入L3和L4后,我们认为世界模型会进化到第二阶段,此时的世界模型可以支撑智能体完成一系列高难度、长程、需要推理的任务,对应的是当下的Claude时刻,能够切实提供极为强大的生产力,完全进入规模商业化阶段。”毛继明指出。

而到L5时,其认为将是整个世界模型的集大成阶段。届时物理智能体可以实现自我设计、自我制造,甚至自主探索整个物理世界,发现其未知的内容,最终形成自进化状态。

“我们当前基本上还是围绕 L1 和 L2 这两层,来实现公司近期目标。”毛继明表示。

新范式涌现:是重构,不是颠覆

当行业还在为VLA与世界模型谁更接近终局争论不休时,另一批玩家却试图跳过这道选择题。

“我认为范式本身不应该是争论的核心,而应当围绕具身智能的真实开发需求,以及具身智能与信息智能之间的区别,找到真正适配的开发方案——我们该如何更好地认知世界、理解任务,最终让单个动作真正拥有通用性与泛化能力,这才是模型开发的最终目标。”光象实验室首席科学家吕尧表示。

至于模型训练完成后,它的形态更接近VLA还是更接近世界模型,这只是开发后的结果,“而不应该从开发初期就用某种范式来限制模型开发。”

这也是光象科技做物理原生智能时最核心的开发思想,也即是“以终为始”,从底层重构具身“大脑”的模型架构。

图片来源:光象科技

据吕尧介绍,光象科技的物理原生智能强调在整个模型开发中,面向智能体与环境交互的需求,在交互中让智能涌现,理解世界将如何变化,动作会产生什么后果,并在学习过程中遵循底层物理规律及安全约束。

“因为人类对物理世界的理解和行为能力仅约10%—20%来自视觉观察与模仿,绝大部分源自真实世界的感知交互与试错反馈。”光象科技创始人兼CEO张涛此前曾指出。

具体而言,光象科技的物理原生智能具备三大基本特征:状态解耦表征、时序因果驱动和物理定律约束,从而让模型更清晰地认知世界,更明确地理解问题,并使学习过程更加稳定。

不过值得注意的是,物理原生智能仍然是以世界模型为核心,并以数据驱动的端到端模型训练为基本架构,但是从世界模型、数据结构和训练算法三个维度,更加深入地考虑物理实体对智能的客观要求,包括物理世界的数据是稀缺的、功能安全性要求是更高的,模型训练是追求稳定性和长期性的。

目前,光象科技已经联合清华大学李升波教授课题组于近期正式发布了第一代物理原生世界模型,即Phi-WM 1.0 ActEffect。据悉,在三项国际机器人操作评测基准上,Phi-WM 1.0 ActEffect均取得了领先成绩。

在物理原生智能路线之外,类脑智能作为另一种技术范式,也开始受到业界关注。

所谓类脑智能,也即借鉴人脑的神经机制与认知架构来构建智能系统,让机器人按生物脑的方式分层感知、决策、反射与学习,代表玩家包括具脑磐石和智平方。

阅读原文 ↗exa-topic-search