在具身智能领域,世界模型一直是机器人实现智能决策的关键支撑。传统模式下,世界模型如同机器人的“脑内沙盘”,在执行任务前,机器人借助它预测未来可能发生的情况,进而规划行动路径。但这种模式存在明显弊端,模型推理链路长,每多运行一步模型,在工业场景中就意味着新的时延、算力消耗和成本增加,这严重限制了具身智能技术在真实生产环境中的大规模部署。
近期,光象科技联合清华大学李升波教授课题组推出的第一代物理原生世界模型Phi-WM 1.0 ActEffect(以下简称ActEffect),为解决这一问题带来了新思路。这一模型不走寻常路,在训练阶段发挥关键作用后,执行任务时便悄然“退场”,却意外地让机器人表现更出色。
ActEffect的突破口在于模仿学习。当前,许多通用机器人策略基于VLA架构,摄像头提供视觉信息,语言指令明确任务,模型依据演示数据生成动作。然而,在物理世界中,动作接近并不一定意味着结果正确。例如,机械臂夹爪合上的时机或手腕角度的细微偏差,都可能导致截然不同的操作结果。ActEffect没有选择延长机器人的思考链,而是让策略一次性给出三版完整动作提案。这三份提案在相同起点下,为比较谁会带来更好后果提供了基础。
随后,受控世界模型登场。它接收当前视觉状态和一份动作提案,预测该动作执行后场景的变化。三份动作提案分别经过受控世界模型的预测,相当于让机器人在训练场提前预演了三次结果。值得一提的是,语言指令留在VLA策略一侧,受控世界模型仅关注当前画面和动作,不读取任务语言。比如,同样伸手推杯子,杯子如何移动取决于其当前位置、周围环境和机械臂动作,与指令是“挪开杯子”还是“清理桌面”无关。ActEffect将未来状态置于冻结的DINOv3视觉特征空间,无需生成逼真未来画面,只需捕捉物体位置、姿态和场景结构的变化,真正体现了“物理原生”的特点。
看过三版结果后,关键环节是将差别反馈给策略。训练数据中有动作执行后的真实观测,受控世界模型将三次预测与真实未来逐一比较,要求精提案比粗提案更接近真实,粗提案优于第一版前馈提案。如此一来,策略每次修改动作都能知晓是否朝着正确方向调整。为防止模型“钻空子”,ActEffect还对排序损失加上梯度截断,确保训练推动更好提案靠近真实未来。通过这种反馈信号学习,世界模型对“后果”的判断融入策略权重。机器人上岗时,受控世界模型和未来观测分支被移除,仅留下MIP动作头完成粗提案和精修。
在多个基准测试中,ActEffect展现出了卓越的性能。在LIBERO基准测试中,包含四组单臂、多任务桌面操作,ActEffect取得了98.8%的平均成功率,比DiT4DiT高出0.2个百分点,且引入后果反馈后,机器人原有的基础操作能力未受影响。LIBERO-PLUS测试加大了难度,通过改变相机视角、机器人初始状态和语言表述,以及在光照、背景、传感器噪声、物体布局上制造变化,ActEffect的平均成功率达到80.3%,远超Fast-WAM的51.5%。在RoboCasa-GR1测试中,模型需控制拥有双臂、灵巧手和腰部自由度的GR-1人形机器人,在29维动作空间完成24项桌面操作,ActEffect的平均成功率达到67.5%,比第二名ABot-M0高9.2个百分点,比Fast-WAM高10.8个百分点。消融实验也进一步验证了ActEffect方法的有效性,去掉后果反馈、将DINOv3特征空间换成VLM表示或拿掉排序损失,成绩均有所下降。
ActEffect的这种设计,与工业部署需求高度契合。在实验室中,具身智能的评价主要看任务成功率,但在真实生产环境里,情况大不相同。仿真环境中多跑一层模型可能只是计算开销的增加,但在汽车工厂等场景中,每一次推理都会产生实际成本,算力也会随规模扩大而大幅增加。ActEffect将受控世界模型留在训练阶段,避免了执行阶段的在线开销,让机器人“多想一会儿”留在训练时,执行时拥有更短的链路。
光象科技选择这样的技术路线,与其进入的场景密切相关。汽车制造中有大量散乱件上下料、复杂曲面质检等任务,传统自动化设备适应能力有限,具身智能有望弥补这一不足。目前,光象科技已围绕焊接上下料、移动质检等典型高价值工位完成真实场景验证,并与多家国内外头部汽车企业展开商业合作。在2026ATC展会上,团队将Phi-Bot X1应用于蔚来汽车焊接上下料场景,机器人连续运行3天,累计作业21.5小时,期间零失误、零中断。
光象科技成立于2025年4月,由清华大学车辆与运载学院和人工智能学院联合孵化。创始人兼CEO张涛是清华大学博士、米兰理工大学博士后,曾担任阿里巴巴高德地图技术总监和空间感知引擎负责人,相关技术已进入汽车量产体系。联合创始人李升波长期从事自动驾驶与具身智能研究,多项技术已应用于产业。光象科技不仅专注于强化学习和世界模型研究,还搭建机器人本体、数据算法体系和开发平台,具备丰富的汽车产业工程经验,这为算法成绩在产线上的落地提供了有力保障。
在具身智能领域,过去两年不乏令人惊艳的演示,但客户现场的连续运行才是真正的考验。机器人不仅要完成正式交付,还需满足节拍、精度、安全性、故障率等验收指标,并具备从一个工位迁移到相似工位、从一家工厂复制到更多工厂的能力。ActEffect将世界模型留在训练场,若能让策略在真机上更稳定,同时节省执行阶段的世界模型开销,那么在机器人复制到更多工位时,算力成本将得到有效控制,这对于准备规模部署的工业系统而言,比单次演示多完成一个动作更具实际意义。











