具身智能数据采集是当前AI产业链中确定性最强、商业化最快的上游基础设施赛道。在人形机器人本体企业普遍亏损的背景下,数据采集作为「卖铲子」生意率先实现正向现金流——单厂投入不足9000万的采集工厂年营收可达数亿元,光轮智能2026年Q1新增订单5.5亿元已超过2025年全年总和。
本报告认为,该赛道正处于从早期扩张向行业整合过渡的关键窗口期。2026年工信部与国资委联合启动实景实训专项行动,标准化体系加速建立,行业有望在未来2-3年形成3-5家具身数据平台型龙头企业。从S基金视角看,数据采集赛道的现金流确定性、强需求刚性和平台化估值溢价,使其成为具身智能产业链中最具LP份额交易价值的细分方向之一。
2026年,具身智能产业正在经历从算法驱动到数据驱动的根本性转向。人形机器人从实验室演示走向工厂、仓储、家庭的真实场景,模型参数规模从几百万跃升至数亿量级,对训练数据的数量和质量要求发生了质变。复旦大学长聘特聘教授张立华指出:「据不完全统计,全球范围内研发端对高质量数据的需求量约为120万小时,而全行业每月数据产出量仅为25万—30万小时。」
这一供需缺口的本质是结构性矛盾——不是简单的「量少」,而是能够支撑复杂物理推演的高质量、多模态、可对齐数据极度匮乏。大语言模型可以通过互联网海量文本训练,但具身智能需要的是包含位置坐标、力矩量化、触觉反馈标注的「交互者视角」数据,互联网上几乎不存在现成的此类数据集。
据京东云产品经理蔡晨估算,完成一个高质量具身模型的训练至少需要一千万小时量级的数据,而当前市场上成熟的具身智能数据集仅几十万小时。这一百倍以上的供需缺口,构成了数据采集赛道确定性增长的底层逻辑。
2026年,具身智能数据领域的政策支持力度达到前所未有的高度:
从政策脉络看,中央和地方政府正系统性地为具身智能数据基础设施建设「铺路架桥」。专项行动明确提出「专项资金、政府奖励」等保障措施,并强调在政策、标准、项目上对成效突出区域与企业予以倾斜支持。这一政策框架为数据采集赛道的规模化发展提供了制度性保障。
多家研究机构对具身智能数据市场的规模预测虽有口径差异,但均指向爆发式增长:
| 研究机构 | 基准年规模 | 预测年规模 | CAGR | 口径说明 |
|---|---|---|---|---|
| 佐思汽研 & 水清木华 | 2025年 2.42亿美元 | 2030年 52.5亿美元 | 85.0% | 含数据生产、标注、平台服务 |
| QYResearch | 2025年 10.3亿美元 | 2032年 89.89亿美元 | 36.8% | 较宽口径,含数据产品与授权 |
| 中商产业研究院 | 2025年 中国5亿元 | — | — | 仅中国市场数据服务 |
| 综合判断 | 2025年全球 3-10亿美元 | 2030年 50+亿美元 | 40-85% | 市场处于爆发前夜,预测分歧大 |
中国市场的增长尤为亮眼——2025年市场规模达5亿元人民币,同比增长203%,占全球约四成。中国核心优势在于全球最完整的机器人硬件供应链(成本仅为欧美的40-60%)以及丰富的制造业和服务业应用场景,为数据采集提供了天然的规模化基础。
从更宏观的视角看,中商产业研究院数据显示2025年中国具身智能整体市场规模约9150亿元,预计2026年突破10904亿元。高盛预测2035年全球人形机器人市场规模将达1540亿美元。数据采集作为占比约15%的上游基础设施,将直接受益于整个具身智能产业的规模化扩张。
觅蜂科技CEO姚卯青对当前市场需求的描述最为生动:「需求方普遍是'你有多少我买多少,你什么时候有,我马上要'。」这一判断背后的逻辑链十分清晰:模型能力上限由数据决定→高质量数据极度稀缺→谁能率先获取数据谁就能在模型竞争中占据先机。
具体来看,需求端呈现三个显著特征:
第一,需求主体多元且付费意愿强烈。数据采集的下游客户覆盖机器人本体企业(宇树、智元、银河通用等)、具身大模型公司(星海图、至简动力等)、科技大厂(京东、华为、蚂蚁等)以及垂直场景应用方。其中,大厂和头部本体企业是最核心的付费方,愿意为高质量数据集支付高溢价。
第二,需求层级分明,从预训练到精调各有侧重。行业普遍采用「海量视频数据(预训练打底)→仿真合成数据(泛化拓展)→真机遥操作数据(精调校准)」的递进式训练路径。这意味着不同类型的数据在产业链中都存在明确的商业价值,只是定价和毛利率差异显著。
第三,需求由模型参数量增长驱动,具有持续扩张性。模型参数从百万级提升至亿级后,数据需求量呈指数增长。正如新时达电气高级研究员丛正所言:「以前几百万参数的模型拿较少数据就能训练达标,现在几亿参数的复杂模型需要极大的数据量才能保障训练达标。」这一趋势意味着数据需求不会随着某一轮模型训练完成而消退,而是持续刚性增长。
具身智能数据的定价体系已初步形成,不同数据类型因采集成本和稀缺性存在显著价差:
| 数据类型 | 典型售价 | 采集成本 | 毛利率 | 核心客户 |
|---|---|---|---|---|
| 真机遥操作常规数据 | 500-1000元/小时 | 300-600元/小时 | 40-55% | 头部本体企业、大模型公司 |
| 高动态数据(跑酷/打球等) | 10元/秒(3.6万/小时) | 高 | 60%+ | 运动控制研发团队 |
| 无本体采集数据 | 200-400元/小时 | 100-200元/小时 | 50-65% | 中小机器人团队 |
| 仿真合成数据 | 按数据集/场景定价 | 极低(仅为真机1%) | 70%+ | 预训练阶段客户 |
| 标准化数据集(可复用) | 按license授权 | 一次性投入 | 80%+(复售) | 多客户复用 |
数据采集的商业模式具有典型的平台化溢价特征。光轮智能的标准化数据集复售率超10倍,单数据集可适配多家机器人厂商的VLA模型训练。鹿明机器人开起的「数据超市」覆盖10大场景、40多种任务,企业下单即可购买。这种「一次生产、多次销售」的模式使得边际成本持续下降,规模效应显著。
展望未来3-5年,具身智能数据需求的演变将呈现以下方向:
从通用场景到垂直行业:当前采集数据以家居、通用操作为主,但随着工业场景率先落地(汽车制造、3C装配、电网巡检等),工业精密制造数据将成为溢价最高的品类。均普智能依托均胜集团全球百家工厂的制造场景切入工业数据采集,正是看准了这一结构性机会。
从「量」到「质」:随着行业标准化推进,单纯堆量的数据将面临贬值压力,而包含力触觉、多模态同步、失败轨迹、纠错样本的高质量数据集将享受更高溢价。一度科技专注的「力觉-视觉-位觉」对齐精细操作数据集,是这一趋势的典型代表。
从单次交易到长期订阅:行业领先的数据平台(如觅蜂科技的MEgo Engine、均普智能的Primus Forge)正在推动从「卖数据产品」到「数据基础设施服务」的商业模式升级,通过平台订阅费和持续数据更新服务构建更稳定的收入流。
据量子位不完全统计,国内97家具身数据玩家中,70家专注数据采集、27家专注数据基础设施。在技术路线上,当前主流方案分为四大类别:
| 技术路线 | 核心原理 | 数据质量 | 扩展性 | 成本 | 玩家数量 | 代表企业 |
|---|---|---|---|---|---|---|
| 真机遥操作 | 人操控真实机器人,同步采集动作/状态/传感器数据 | 最高 | 中低 | 最高(500-1000元/h) | 22家(31%) | 帕西尼、千寻智能、国资平台 |
| 无本体采集 | 人穿戴设备直接演示,无需机器人参与 | 较高 | 高 | 中等(为真机1/3) | 15家(21%) | 觅蜂科技、鹿明机器人、简智机器人 |
| 仿真合成 | 在虚拟环境批量生成机器人交互数据 | 中(Sim-to-Real有鸿沟) | 最高 | 极低(真机1%) | 2家纯路线 | 光轮智能、松应科技 |
| 互联网视频蒸馏 | 从互联网视频提取人类动作知识转化为可学习数据 | 最低 | 最高 | 最低(千分之五) | 1家纯路线 | 枢途科技 |
| 跨路线融合 | 同时布局多条路线 | 综合优 | 综合优 | 取决于配比 | 30家(43%) | 最多玩家选择 |
值得关注的是,跨路线玩家数量(43%)超过了任何单一路线。这说明行业共识是没有任何一种采集方式能独立满足机器人训练的完整需求。行业采用「数据金字塔」结构——底层用低成本视频/仿真数据做预训练,中层用无本体数据扩充场景覆盖,顶层用高成本遥操作数据做精调——这种融合路径正在成为主流。
按企业背景和商业模式,97家国内玩家可分为五大类:
���光轮智能、觅蜂科技、帕西尼感知科技、鹿明机器人、简智机器人为代表。这类企业不造机器人本体、不开发大模型,专注数据采集与治理,是国内市场最大的玩家群体。优势在于中立性(可服务多家下游客户)、专业性和轻资产扩张能力。光轮智能估值已突破150亿元,是赛道首个独角兽。
以各地人形机器人创新中心、数据训练基地为代表。这类平台享有政府资金和场景资源支持,适合做真机遥操作等重资产路线。北京人形机器人创新中心数据基地日产能达600小时,已积累4万小时数据,合格率95%以上。劣势在于市场化程度和运营效率。
以宇树科技、银河通用、智元机器人、星海图为代表,自建数据采集产线,数据用于自身模型训练。宇树已全量开源189万条动作轨迹数据集;智元开放AGIBOT WORLD 2026数据集;银河通用构建了百亿级具身智能数据集。这类企业的数据能力可能向外部开放,成为第三方数据供应的竞争者。
以均普智能为代表,从智能制造、AI标注、自动驾驶等领域转型切入。均普智能依托母公司全球百家工厂的真实产线,发布Primus Forge数据平台和PrimusEgo采集设备,深度锚定工业精密制造场景——这是最稀缺、价值最高的数据资产来源。
京东发布自研可穿戴采集终端JoyEgoCam,计划2年内完成1000万小时视频数据采集;华为推出CloudRobo;蚂蚁集团通过投资简智机器人、觅蜂科技等布局。这类企业不把数据采集作为主营业务,但凭借场景和数据规模优势可能重塑竞争格局。
全球具身智能数据市场正在形成清晰的国别分工:
美国:平台层主导。Scale AI是海外标杆,从自动驾驶标注起家,深度绑定OpenAI做大模型评测。2026年3月与Universal Robots合作推出UR AI Trainer系统切入具身智能赛道,利用UR全球部署的机器人构建数据飞轮。NVIDIA则以Cosmos世界模型、Isaac Sim仿真平台和GR00T开源数据集定义全球数据基础设施标准。美国企业的核心优势在于技术平台和生态标准。
印度:低成本劳动密集。印度走的是规模化人力采集路线,利用廉价劳动力进行大规模数据标注和动作示范采集。这种模式在成本上极具竞争力,但数据质量和标准化程度是主要制约。
中国:基建与产能领先。中国在三个维度上构建了独特优势:一是硬件供应链完整且成本仅为欧美40-60%,数据采集设备(手套、头显、传感器)国产化率快速提升;二是场景丰富度全球领先,制造业、服务业、家庭等场景为数据采集提供天然试验场;三是政府主导的基础设施建设速度和规模远超其他国家。全国已建立超43座人形机器人训练场,累计汇聚近3000万条具身智能数据。
具身智能数据采集赛道在2025-2026年经历了从冷到热的极速升温。据量子位统计,过去一年(2025年7月至2026年7月),15家独立具身数据服务商(即不做机器人本体、不做大模型、只做数据)合计融资约44.7亿元人民币。这一数字放在整个具身智能赛道中也许不算惊人——上半年「大脑」方向的公司6个月就融资223亿元——但考虑到数据采集企业大多成立于2024年下半年到2025年,这一融资速度和规模已属罕见。
当前赛道头部企业已形成清晰的估值梯队:
| 企业 | 成立时间 | 最新估值 | 核心路线 | 主要投资方 | 核心优势 |
|---|---|---|---|---|---|
| 光轮智能 | 2023年 | 150亿+元 | 仿真合成+无本体 | 蚂蚁集团、经纬创投、中关村科学城基金 | 仿真引擎+三层架构,客户覆盖NVIDIA/谷歌/Figure |
| 帕西尼感知 | 2021年 | 100亿+元 | 真机遥操+触觉 | 比亚迪、黄浦江资本、凯泰资本 | 6D触觉传感+实体采集工厂+OmniVTLA大模型 |
| 觅蜂科技 | 2026年2月(分拆) | 数十亿元 | 无本体+真机+仿真全覆盖 | 红杉中国、国方创投、智元机器人 | MEgo设备+MEgo Engine平台+全范式覆盖 |
| 简智机器人 | 2025年7月 | 数十亿元 | 无本体采集基础设施 | 蚂蚁集团、滴滴、德联资本 | Gen DAS设备+Gen ADP数据产线+海外收入七成 |
| 鹿明机器人 | 2024年 | 未披露 | 无本体采集 | 未披露 | 采集效率10倍提升+全球2/3顶尖团队采用 |
| 诺亦腾机器人 | 2025年(分拆) | 数十亿元 | 动作捕捉+无本体 | 未披露 | 全球70%动捕市场份额,服务60+机器人企业 |
| 灵初智能 | 2024年 | 未披露 | 轻量化穿戴采集 | 未披露 | 100套数据手套+10万小时手部操作数据 |
从投资方结构看,产业资本+国资+头部VC的三角架构正在成为标配。产业资本(比亚迪投资帕西尼、蚂蚁投资简智/光轮/觅蜂)提供场景和订单验证,国资(中关村科学城基金、四川发展科创基金)提供政策和资金背书,头部VC(红杉、经纬)提供估值和退出通道。这一资本结构兼具确定性和成长性溢价,为后续IPO和并购退出奠定了多元化的股东基础。
这是一个值得S基金深入思考的反直觉现象:不造机器人的数据公司估值增速和盈利确定性超过了造机器人的本体公司。背后有三层逻辑:
第一层:盈利先行。当人形机器人本体企业还在亏损时,数据采集公司已经实现了正向盈利。光轮智能2026年Q1新增订单5.5亿元,超过2025年全年总和;无问智科一季度手握数亿元订单。觅蜂CEO姚卯青的判断已被市场验证:「在具身智能尚未真正大规模商业化之前,数据作为基础设施,会比终端应用更早形成商业回报。」
第二层:资产可复用。与机器人本体的一次性销售收入不同,数据资产具有「一次生产、多次贩卖」的特征。光轮智能的标准化数据集复售率超10倍,同一数据集可同时授权给多家机器人厂商。这种商业模式天然具备软件/SaaS行业的估值溢价——高毛利率、低边际成本、强网络效应。
第三层:客户中立性。独立数据服务商不制造机器人,因此可以服务全行业客户。这与Scale AI在AI标注领域的崛起逻辑一脉相承——当一个行业的所有玩家都需要同一种「铲子」时,卖铲子的人就是最确定的赢家。
目前A股市场上,与具身智能数据采集直接相关的标的极为稀缺,这本身就是一个稀缺性溢价信号。具身智能数据采集作为一个2025年才真正爆发的新赛道,A股中纯正的标的凤毛麟角:
| 股票代码 | 公司名称 | 总市值 | 2026Q1营收 | 毛利率 | PE(TTM) | 具身数据业务进展 |
|---|---|---|---|---|---|---|
| 688787 | 海天瑞声 | 58.24亿 | 9678万 | 56.43% | 263x | 已与头部具身厂商签署真机数据采集合约;北京运营首个训练场,100+台机器人 |
| 688306 | 均普智能 | 102.56亿 | 4.71亿 | 18.07% | 1269x | 2026年7月发布Primus Forge数据平台+PrimusEgo采集设备;依托均胜集团全球百家工厂 |
海天瑞声(688787)从传统AI数据标注向具身智能数据领域延伸,2026年Q1营收同比增长38.63%,归母净利润同比增长2161%。公司已在北京运营首个具身智能数据训练场,依托100+台机器人实现高效数据产出。其传统业务(AI训练数据)的客户基础和标注能力可以为具身智能业务提供协同优势,但当前具身智能数据收入占比仍较低,是「转型中」而非「已转型」。
均普智能(688306)依托均胜集团60余年智能制造积累的全球百家工厂场景,于2026年7月发布工业具身智能数据平台Primus Forge。其核心差异化在于深度锚定工业精密制造场景——具身智能模型训练中最稀缺、价值最高的数据资产来源。但公司当前仍处于亏损状态(2026Q1归母净利润-3431万),具身智能数据业务尚属早期布局,对业绩贡献有限。
此外,新三板挂牌的数据堂(831428)也从2024年起正式布局具身智能数据,采用「场内模拟+场外真实」双轨采集策略,覆盖零售、家居、仓储、医疗等多类场景。但新三板的流动性和估值体系与A股不可同日而语。
除了直接参与数据采集的公司,A股中还有一批通过产业链环节间接受益的企业:
| 关联环节 | 代表公司 | 映射逻辑 |
|---|---|---|
| 动作捕捉设备 | 利亚德(OptiTrack光学动捕) | 光学动捕是遥操作和动作采集的核心硬件,利亚德旗下OptiTrack全球市占率高 |
| 机器人本体 | 优必选(港股)、宇树科技(IPO中) | 本体企业既是数据消费方也是数据生产方,宇树已开源189万条数据集 |
| 传感器 | 柯力传感、汉威科技 | 力/触觉传感器是数据采集设备的核心组件 |
| 算力基础设施 | 中科曙光、浪潮信息 | 仿真合成数据生成和模型训练需要大规模算力支撑 |
具身智能赛道的IPO浪潮正在来临,这将为数据采集公司的退出通道提供重要参考:
对于S基金而言,数据采集公司的退出路径更加多元化:一方面可以跟随本体企业IPO浪潮享受估值提升,另一方面由于数据资产的高复用性和平台属性,被大厂(蚂蚁、京东、华为等)或头部本体企业并购的逻辑同样成立。独立数据服务商的中立性使其成为稀缺的并购标的——大厂和头部企业有强烈的数据基础设施自建需求,收购现成的数据平台是最直接的手段。
工信部与国资委的专项行动要求在2026年11月30日前完成成效总结。10个重点省市将建设不少于200个重点场景单元(每省不少于20个),组建创新应用联合体,打造实景实训空间。这意味着2026年下半年将迎来一波集中性的数据需求释放——场景建设本身需要大量基准数据,联合体的模型训练需要持续数据供给,这将直接拉动数据采集公司的订单增长。
宇树科技作为A股「人形机器人第一股」,其IPO定价和上市后股价表现将确立整个具身智能产业链的二级市场估值基准。如果IPO定价对应较高估值(当前预估约420亿元),将推动一级市场估值中枢上移,数据采集公司作为产业链最上游的「卖铲人」将率先受益。
2026年2月发布的《人形机器人与具身智能标准体系(2026版)》是行业从混乱走向有序的关键一步。标准化将降低数据跨本体迁移的门槛,打破「数据孤岛」,使得同一份数据可以服务更多下游客户——这将直接提升数据采集公司的资产利用效率和毛利率。
仿真数据与真实数据的鸿沟(Sim-to-Real Gap)是当前制约仿真合成路线商业价值的最大瓶颈。NVIDIA Cosmos世界模型和光轮智能等企业的高保真仿真引擎正在缩小这一差距。一旦Sim-to-Real问题得到实质性突破(仿真训练的策略在真实机器人上的成功率超过80%),仿真合成路线的数据价值将实现数量级跃升,因为其边际成本趋近于零的特性将彻底改变行业成本结构。
多位行业人士判断,2026-2027年工业场景是最有希望承载具身机器人规模商用的场景。汽车制造(宁德时代、比亚迪、博世)、3C电子、电网巡检等场景由于相对封闭、任务标准化程度高,是数据采集第一批实现商业闭环的领域。均普智能、一度科技等聚焦工业场景的玩家可能率先证明商业模式。
简智机器人海外收入占比已超七成;光轮智能的客户名单覆盖NVIDIA、谷歌、Figure等海外巨头。中国数据采集公司凭借成本优势和规模效应,正在从「服务国内市场」走向「全球化供给」。这一趋势的持续强化将打开数倍于国内市场的成长空间。
经过系统研究,我们对具身智能数据采集赛道的整体判断如下:
从S基金偏好的现金流视角看,具身智能数据采集赛道具有高度吸引力:
数据采集公司的退出路径较传统制造业企业更为多元化:
按S基金3-7年持有周期的估值安全边际评估:
| 优先级 | 标的类型 | 代表企业 | 核心逻辑 | S基金参与方式 |
|---|---|---|---|---|
| 第一梯队 | 全路线平台型数据服务商 | 光轮智能、觅蜂科技 | 估值虽高但确定性强,全范式覆盖+平台化交付,客户结构全球化 | 关注老股转让机会,需折价安全垫 |
| 第二梯队 | 垂直场景数据专家 | 帕西尼感知(触觉)、一度科技(灵巧手)、鹿明机器人(无本体) | 技术壁垒高、细分赛道龙头、估值相对理性 | LP份额交易首选,持有至并购退出 |
| 第三梯队 | 基础设施型数据平台 | 简智机器人、公象智能 | 轻资产模式、可规模化、海外收入占比高 | 早期LP份额交易,关注海外扩张进度 |
| A股映射 | 转型布局的上市公司 | 海天瑞声、均普智能 | 具身数据业务占比低但增长快,A股稀缺性溢价 | 二级市场配置,关注业务占比拐点 |
具身智能数据采集是2026年最具确定性的AI基础设施赛道之一。在人形机器人产业化的宏大叙事中,数据作为「新的石油」,正在成为决定行业竞争格局的关键战略资源。我们看到:数据已经先于机器人本体实现盈利,独立数据服务商以「卖铲人」的身份率先享受了行业红利。
从S基金视角出发,该赛道的核心投资逻辑在于:选择具备平台化能力、跨路线布局、客户结构多元化、且估值处于合理区间的独立数据服务商,以LP份额交易或老股转让方式参与,持有至IPO或产业并购退出。在估值泡沫和确定性增长之间寻找平衡,将是S基金在该赛道获取超额回报的关键。
—— 博瑔资本 S基金投研小队 ——
本报告仅供内部研究参考,不构成任何投资建议。数据来源截至2026年7月28日。