在刚刚落幕的2026世界人工智能大会(WAIC)上,具身智能展区成为焦点。参展企业数量从去年的80余家激增至200余家,展台的核心议题也从往年的机器人运动能力或模型参数规模,转向更具根本性的问题:机器人的“大脑”究竟该以何种形态存在?
过去三年,视觉-语言-动作模型(VLA)被视为具身智能的“标准大脑”。这种技术路线通过将视觉输入、语言指令与动作输出直接关联,让机器人能够理解并执行复杂任务。然而,2026年的WAIC上,这一共识被彻底打破。行业观察显示,企业正围绕“大脑”形态展开三派竞争:系统分层派、统一模型派与场景适配派。
系统分层派的代表是深圳逐际动力公司。其发布的LimX COSA 0.5系统将机器人认知分解为三层架构:顶层负责场景理解与决策规划,中层处理技能库调用,底层执行运动控制。在演示视频中,全尺寸人形机器人Oli独立完成取衣、收纳、搬箱等家务任务,全程无远程操控或剪辑。逐际动力创始人张巍强调:“VLA只是技能模块,真正的‘大脑’需要系统化思维。”这一观点得到Figure AI、英伟达等企业的呼应。Figure AI的Helix模型采用双系统架构,分别处理慢速场景理解与快速动作执行;英伟达GR00T N1则模仿人类“快思考”与“慢思考”的认知分工。
统一模型派则主张用单一神经网络贯通感知、决策与执行全链条。它石智航公司今年3月发布的AWE 3.0系统,通过“AI世界引擎”实现端到端控制。联合创始人丁文超指出,VLA模型仅能处理像素级信息,缺乏对物理世界的时空感知与交互直觉。自变量机器人创始人王潜从工程角度补充:“分层架构的误差会逐级放大,端到端模型更稳定。”海外企业Skild AI同样采用通用模型控制多类型机器人。
第三条路线跳出技术架构之争,转而聚焦场景需求。酷哇科技发布的CooWAIM 2.0模型,通过在隐空间中模拟2-3秒的未来场景,优化环卫机器人的实时决策。公司透露,该模型在推演2秒时性能提升显著,但延长至4秒后收益递减。“环卫车不需要预测十分钟后的街道。”酷哇科技负责人解释。这种“够用即好”的思路在仓储领域同样适用。极智嘉展示的人形拣选机器人Gino 1,专门针对仓库场景优化,可抓取异形、软质包裹;云深处的工业机器人DR02则在变电站完成商用验证。
三派竞争的实质是数据策略的分野。分层派混合使用真机数据、合成数据与互联网视频;统一派依赖人类操作的真实场景数据;场景派则通过数千台在役机器人持续回传作业数据。尽管各派均展示出技术突破,但商业化验证仍是共同挑战。自动驾驶行业的前车之鉴表明,实验室演示与真实场景存在巨大差距。2026年WAIC抛出的问题,最终答案将写在产线上——谁能卖出更多机器人,谁就能定义“大脑”的标准。











