两个月内连续完成两轮融资,估值增长超10倍,成立仅一年多的「眸深智能」正成为具身智能赛道最受关注的“大脑”公司之一。这家由复旦大学教授、前英特尔首席科学家联合创立的硬科技企业,近日宣布完成近亿元Pre-A轮追加融资,其独特的“世界动作模型”技术路线,正在颠覆行业对机器人动作生成的认知。
创始团队:三位“顶配”大脑的碰撞
眸深智能成立于2025年1月,创始人阵容堪称豪华:复旦大学深度学习实验室主任陈涛教授、原英特尔中国首席科学家张益民博士,以及连续创业者穆泽林。核心团队还汇聚了来自海思、英特尔、英伟达三大芯片巨头的技术骨干,是国内少数具备算子级适配能力的具身大模型团队。
这种“学术+产业+创业”的复合背景,让眸深智能从一开始就选择了与主流VLA(视觉-语言-动作)截然不同的技术路径——以动作为核心的“世界动作模型”(World Motion Model)。在创始人看来,动作才是机器人理解物理世界的关键,而非语言或视觉的简单叠加。
技术路线:从“如何生成动作”到“如何指挥动作”
眸深智能的技术积累始于2022年。当时,团队全球首次提出MLD(隐空间动作扩散模型),将动作映射到隐空间,让AI像画家去噪一样从随机噪声中还原出自然连贯的人体姿态,彻底解决了传统方法中动作僵硬、缺乏多样性的问题。
2023年9月,团队进一步发布MotionGPT,将人体姿态拆解为约3000个“动作基元”,类比汉字的笔画。通过预测下一个“动作token”,模型能像大语言模型生成句子一样生成复杂行为。这种连续动作离散化的处理方式,让机器人具备了零样本泛化能力——即使从未见过的动作指令,也能通过重组动作词汇来理解并执行。MotionGPT是全球首个把动作做成token的具身大模型,发表于NeurIPS 2023。
到了2026年,团队已累计发布7代模型,并推出STI-WM(时空一体世界动作模型)具身大模型。该模型采用“80%互联网视频+10%动捕数据+10%真机数据”的训练配方,将真机数据需求降低90%,动作准确度提升至99%。同时,今年3月提出的T²MB(Task*Task Motion Brain)让机器人具备离线自进化能力,部署到端侧后无需联网回传数据,仅凭本地交互就能持续优化性能,任务执行准确度最高提升25%。
模型压缩:将端侧算力成本打下来
真正决定具身大脑能否规模化的,除了技术路线,还有端侧算力成本。眸深智能从第一代模型起就同步推进模型压缩与国产芯片适配。通过模型蒸馏、冗余参数压缩等手段,将千亿参数级模型压缩至百亿级别,参数量降低约75%,端侧推理延迟从约200毫秒降至10毫秒。
更关键的是,团队同步适配海思、地平线、燧原等国产芯片平台,实现低功耗、高实时、超低成本的端侧推理。结果令人瞩目:模型端侧推理成本从20万元降至1万元,大脑续航时间提升10倍,而精度和性能却不掉点。这一压缩工作还获得了IJCAI 2025全球最佳论文奖,是近五年唯一获此奖项的中国大陆团队。
商业化落地:已有营收,客户覆盖多场景
眸深智能是目前国内少数有营收的具身智能大脑公司。2025年审计回款收入千万元,2026年上半年已实现3000万元,预计全年营收规模超过5000万元。公司客户覆盖工业检测、物业、环卫等场景,已与某港股上市物业公司、A股上市环卫龙头完成机器人产品交付,并正在推进与头部连锁零售集团、头部白色家电工厂的人形机器人落地场景研发。
行业意义:技术路线获国际认可,国产芯片原生适配
值得注意的是,英伟达DAIR实验室在最新ARDY模型中,援引了眸深智能的MLD与MotionGPT两项原创技术——这是近两年英伟达第三代动作模型对该公司的第四次引用。这标志着中国团队在具身智能底层技术上的原创能力已获国际顶级机构的认可。
在技术栈自主可控方面,眸深智能创始人、CEO穆泽林表示,国内具身智能行业普遍采用在国外芯片上训练、再移植适配国产芯片的方案,性能损耗与兼容性问题突出。而眸深智能未来将在模型训练、推理全流程中基于国产算力芯片原生开发,实现技术栈完全自主可控。
从技术路线的差异化创新,到模型压缩带来的成本剧降,再到商业化落地的快速推进,眸深智能正在用实际成果证明:真正的具身智能,不需要依赖海量真机数据,也无需昂贵的算力堆砌。当“大脑”的成本降到万元级别,10亿台机器人的想象空间,或许不再遥远。