在具身智能赛道,一家名为「眸深智能」(Motion Brain)的企业正以独特的技术路线和商业落地能力引发行业关注。近日,硬氪获悉,该公司完成近亿元Pre-A轮追加融资,投资方包括头部物业服务公司、香港财团、瑾悦投资、创合汇资本及老股东徐汇资本。这是继2026年5月3亿元Pre-A轮融资后,其两个月内第二次获得资本青睐,同时Pre-A+轮近5亿元融资已进入交割阶段。数据显示,该公司今年上半年估值增长超10倍,成为国内成长最快的具身大脑企业之一。
与传统具身智能企业不同,「眸深智能」选择以动作为核心构建技术壁垒。其创始人穆泽林将公司定位为“全球最懂动作的自进化具身大脑公司”,目标是为10亿台机器人提供原生通用大脑。这一愿景背后,是团队自2022年起的技术积累:彼时行业普遍将动作视为离散信号,导致机器人动作僵硬且缺乏多样性,而「眸深智能」全球首创将动作映射至隐空间,并引入扩散模型,让AI像画家去噪般从随机噪声中生成自然连贯的人体姿态。这项技术被命名为MLD(隐空间动作扩散模型),相当于让机器人摆脱“逐帧教学”的局限,实现动作的自主生成。
2023年9月,团队进一步发布MotionGPT,将技术推向新高度。通过将人体姿态拆解为约3000个“动作基元”,并借鉴大语言模型预测下一个token的逻辑,MotionGPT可预测下一个“动作token”以生成复杂行为。这种将连续动作离散化的处理方式,不仅提升了模型对长序列任务的理解能力,更赋予机器人Zero-Shot(零样本)泛化能力——即使面对未训练过的动作指令,也能通过重组动作词汇完成执行。该成果发表于NeurIPS 2023,成为全球首个将动作token化的具身大模型。
技术突破的背后,是团队对数据训练范式的革新。2026年推出的STI-WM(时空一体世界动作模型),彻底摆脱了传统VLA(视觉-语言-动作)模型对海量真机数据的依赖。其采用“80%互联网视频+10%动捕数据+10%真机数据”的混合训练方式,结合MotionGPT建立的动作词典,从无标注视频中学习物理规律,再用少量动捕数据校准生物力学特征,最终仅用10%的真机数据完成闭环对齐。这一模式将真机数据需求降低90%,同时将动作准确度提升至99%。
端侧算力成本的控制,是「眸深智能」的另一大竞争优势。据介绍,团队从第一代模型起便同步推进模型压缩与国产芯片适配:通过蒸馏、冗余参数压缩等技术,将千亿参数级模型压缩至百亿级别,参数量降低约75%,端侧推理延迟从200毫秒降至10毫秒;同时适配海思(昇腾310/910)、地平线、燧原(燧原S60)等国产芯片平台,实现低功耗、高实时、超低成本的端侧推理。这种软硬协同的打法,使模型端侧推理成本从20万元降至1万元,大脑续航时间提升10倍,且精度和性能不受影响。该压缩工作还帮助团队获得IJCAI 2025全球最佳论文奖,成为近五年唯一获此奖项的中国大陆团队。
商业化层面,「眸深智能」已展现强劲实力。其2025年审计回款收入达千万元,2026年上半年增至3000万元,预计全年营收将突破5000万元。目前,公司客户覆盖工业检测、物业、环卫等场景,并与某港股上市物业公司、A股上市环卫龙头完成机器人产品交付,同时推进与头部连锁零售集团、白色家电工厂的人形机器人落地研发。创始人穆泽林透露,公司可在两周内完成具身大模型从一种本体到另一种本体的适配,包括复旦自研的“光华1号”、宇树G1、上海人形机器人创新中心的“青龙”和“灵龙”等。
在技术路线选择上,穆泽林坚持“动作优先”的逻辑。他认为,具身智能的核心是解决“执行层”问题,而动作token的泛化能力(Zero-Shot)可让机器人通过动作序列迁移完成新任务。例如,机器人学过拿矿泉水瓶后,即使未学过拿手机,也能通过动作迁移实现80%的准确度,剩余20%通过少量后训练或强化学习校准即可。这种务实策略,使其在技术路线分化的具身智能领域占据独特位置。
对于国产算力的选择,穆泽林表示,长期来看,国产GPU是必然方向。团队凭借海思、英特尔、英伟达三大芯片巨头的背景,成为国内唯一具备算子级适配能力的具身大模型团队,目前已打通燧原S60、昇腾310/910等国产芯片的部署,下半年目标攻克千卡级国产集群训练,实现纯国产化的大模型训练方案。这种策略不仅能解决供应链安全问题,更能提升资本效率——通过算子优化,其训练成本可降低至行业平均水平的十分之一。
谈及产业分工,穆泽林预测,具身智能领域将形成“一超多强”格局:通用大脑研发门槛极高,国内真正具备能力的团队屈指可数,「眸深智能」的目标是成为“超级通用大脑”,同时允许其他团队聚焦细分场景。他强调,5-10年内,不会出现每家机器人公司都自研大脑的情况,创业公司的灵活性和专注度将在软硬件深度结合的具身智能领域占据优势。










