载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

具身数据狂飙:近百玩家一年融资44.7亿,谁能靠“卖数据”赚钱?

· · 阅读 5 分钟

湖南郴州,一家中国移动营业厅挂出“具身数据采集5S店”招牌。顾客领一套夹爪、手套和头戴相机,经过简单培训,就能边做家务边采集机器人训练数据。首期投放的1000套设备,满产状态下每年可采集100万小时数据。这个看似“花活”的案例,折射出机器人产业最迫切的焦虑——缺数据。而一场围绕数据采集、加工和销售的竞赛,正在近百家企业间悄然拉开。

技术路线多样,跨路线成主流

目前主流具身数据采集技术路线可分为四大类:真机遥操(人类操控真实机器人执行任务,同步采集动作与传感器数据)、无本体采集(人直接完成示范,通过动捕、夹爪映射、第一视角相机等设备采集动作,无需机器人参与)、仿真合成(在虚拟环境中批量生成交互数据)、互联网视频蒸馏(从互联网视频中提取人类动作知识,转化为可学习数据)。

量子位统计的70家数据采集公司中,有30家同时走多条采集路线,占比高达43%。跨路线采集成为最拥挤的赛道,原因很简单:没有任何一种采集方式能独自满足机器人训练所需的数据金字塔结构——真实物理世界的摩擦、形变、力觉与触觉反馈,仿真技术至今难以高保真还原。

单独押注真机遥操路线的玩家最多,有22家,占31%。其中13家是国资数据平台,7家是机器人公司,还有1家从AI数据标注转型、1家从工业装备制造跨界。机器人公司有硬件和真实需求,国资平台则“不怕重”——遥操是重资产路线,需要买本体、租场地、雇操作员,这些正是国资容易调动的资源。

无本体采集路线公司最年轻,大多数成立于2024年9月之后,技术子类丰富:Ego视角、UMI、动作捕捉、sEMG肌电、触觉采集等。而仿真合成的独立玩家仅剩2家,曾经以仿真为核心的光轮智能、银河通用等知名公司,都已转向“多篮子”策略,开始采集人类数据或开发遥操作系统。互联网视频蒸馏路线目前只有枢途科技一家,宣称能通过单目RGB视频将综合采集成本降至行业平均水平的千分之五。

玩家阵营分明,独立服务商崛起

量子位不完全统计了97家国内具身数据玩家,其中70家做数据采集,27家做数据infra。按身份分类,独立数据服务商39家占40%,国资数据平台25家占26%,机器人公司24家占25%,工业和IT跨界公司5家,大厂平台型公司4家(华为、京东等)。

独立数据服务商已成为最大玩家群体,这标志着具身数据已从机器人公司的附属部门,成长为一条独立赛道。过去一年(2025年7月至2026年7月),15家“不做本体、不做模型、只做数据”的独立数据服务商共融资约44.7亿元。这个数字虽不及具身“大脑派”公司半年223亿元的融资规模,但考虑到数据服务商普遍轻资产、重模式的特点,已是相当可观。

值得一提的是,三分之二玩家属于“具身原生”公司(成立之初主业就是具身数据或具身智能),三分之一是“跨界转型”公司(从AI数据标注、自动驾驶、动作捕捉或工业领域转型)。但细分来看,数据采集公司中约八成是具身原生,而数据infra公司中约七成是跨界转型。原因在于:infra环节依赖成熟的管线、质检和交付能力,AI数据标注公司(如海天瑞声、数据堂、云测数据)可平移经验;而采集环节需从零构建资产,老玩家无优势,新公司反而能轻装上阵。

行业意义:数据驱动具身智能,但挑战犹存

具身数据赛道的火热,本质是机器人产业从“模型驱动”向“数据驱动”的转型。过去,机器人依赖工程师手工编程完成特定任务;如今,大模型和端到端学习要求海量、高质量、多场景的交互数据。谁掌握了数据生产流水线,谁就掌握了具身智能的“燃料”。

然而,行业的隐忧同样明显。采集成本居高不下:真机遥操需昂贵的机器人本体和专业操作员,无本体采集设备虽便宜但难以覆盖复杂场景,仿真合成又有sim2real gap。商业化路径尚不清晰:多数独立数据服务商仍在烧钱融资,尚未证明能稳定盈利。数据质量参差不齐:从营业厅“花活”到VR游戏式采集,不少环节缺乏严格的质量控制标准。

可以预见,未来1-2年将进入洗牌期。拥有技术壁垒(如低成本高质量蒸馏方案)、客户粘性(绑定头部机器人公司)或规模化优势(如国资平台的“重资产”模式)的玩家,才有可能成为真正的“卖水人”。而那些仅靠营销噱头或低门槛采集赚快钱的公司,终将被市场淘汰。