返回作品集
S基金 · 产业链深度研报

具身智能数据采集领域
行业研究报告

2026年被业界称为「具身数据元年」,作为人形机器人产业链最上游的「卖铲人」赛道,数据采集正以惊人的速度崛起——97家国内玩家涌入,15家独立数据服务商一年融资超44.7亿元,首个具身数据独角兽估值突破150亿元。本报告从S基金视角,系统梳理该赛道的宏观驱动、技术路线、竞争格局、一级市场融资及A股对标,为投资决策提供深度参考。

博瑔资本 · S基金投研小队
投资总监:投研小队长 | 执行研究员:@数据研究员、@写手
2026年7月28日 · 内部研究资料

执行摘要

具身智能数据采集是当前AI产业链中确定性最强、商业化最快的上游基础设施赛道。在人形机器人本体企业普遍亏损的背景下,数据采集作为「卖铲子」生意率先实现正向现金流——单厂投入不足9000万的采集工厂年营收可达数亿元,光轮智能2026年Q1新增订单5.5亿元已超过2025年全年总和。

本报告认为,该赛道正处于从早期扩张向行业整合过渡的关键窗口期。2026年工信部与国资委联合启动实景实训专项行动,标准化体系加速建立,行业有望在未来2-3年形成3-5家具身数据平台型龙头企业。从S基金视角看,数据采集赛道的现金流确定性、强需求刚性和平台化估值溢价,使其成为具身智能产业链中最具LP份额交易价值的细分方向之一。

85.0%
2025-2030年全球具身数据市场CAGR(佐思汽研)
52.5亿$
2030年全球市场规模预测
44.7亿
过去一年15家独立数据服务商融资总额(人民币)
97家
国内具身数据玩家总数(采集70家+基础设施27家)
150亿+
光轮智能最新估值(人民币)
50万h
全球高质量真实物理交互数据总量
5亿
2025年中国具身数据市场规模(人民币)
99%+
具身数据供需缺口(需求千万小时级vs供给50万小时)

目录

  1. 宏观环境:具身数据元年的政策、资本与产业共振
  2. 客户需求:数据饥渴驱动下的需求结构与付费逻辑
  3. 竞争格局:四大技术路线与五类玩家生态
  4. 一级市场:资本狂飙与估值分化
  5. A股市场:上市标的梳理与对标分析
  6. 催化因素:政策、技术与商业化的三重驱动
  7. 总结与S基金视角:投资机会与退出路径研判
Chapter 1

宏观环境:具身数据元年的政策、资本与产业共振

2026年被称为「具身数据元年」,政策驱动、资本涌入、产业需求三重力量交汇

1.1 具身智能进入数据驱动阶段

2026年,具身智能产业正在经历从算法驱动到数据驱动的根本性转向。人形机器人从实验室演示走向工厂、仓储、家庭的真实场景,模型参数规模从几百万跃升至数亿量级,对训练数据的数量和质量要求发生了质变。复旦大学长聘特聘教授张立华指出:「据不完全统计,全球范围内研发端对高质量数据的需求量约为120万小时,而全行业每月数据产出量仅为25万—30万小时。」

这一供需缺口的本质是结构性矛盾——不是简单的「量少」,而是能够支撑复杂物理推演的高质量、多模态、可对齐数据极度匮乏。大语言模型可以通过互联网海量文本训练,但具身智能需要的是包含位置坐标、力矩量化、触觉反馈标注的「交互者视角」数据,互联网上几乎不存在现成的此类数据集。

核心矛盾——具身数据的「不可能三角」:高质量、大规模、低成本三大要素无法同时兼得。真机遥操作数据质量最高但成本最贵(500-1000元/小时),仿真合成可规模化但存在Sim-to-Real鸿沟,互联网视频成本最低但缺乏力触觉等关键信息。行业共识正在从「单点采集」走向「多源融合」。

据京东云产品经理蔡晨估算,完成一个高质量具身模型的训练至少需要一千万小时量级的数据,而当前市场上成熟的具身智能数据集仅几十万小时。这一百倍以上的供需缺口,构成了数据采集赛道确定性增长的底层逻辑。

1.2 政策顶层设计:从指导意见到专项行动

2026年,具身智能数据领域的政策支持力度达到前所未有的高度:

工信部、国资委联合发文的战略意图:「通过集约化建设、标准化管理、资源共享的实训空间,可有效避免场景重复建设和资源浪费,推动场景、数据、算力与技术成果高效复用,大幅降低企业试错成本。」

从政策脉络看,中央和地方政府正系统性地为具身智能数据基础设施建设「铺路架桥」。专项行动明确提出「专项资金、政府奖励」等保障措施,并强调在政策、标准、项目上对成效突出区域与企业予以倾斜支持。这一政策框架为数据采集赛道的规模化发展提供了制度性保障

1.3 市场规模与增长预期

多家研究机构对具身智能数据市场的规模预测虽有口径差异,但均指向爆发式增长

研究机构基准年规模预测年规模CAGR口径说明
佐思汽研 & 水清木华2025年 2.42亿美元2030年 52.5亿美元85.0%含数据生产、标注、平台服务
QYResearch2025年 10.3亿美元2032年 89.89亿美元36.8%较宽口径,含数据产品与授权
中商产业研究院2025年 中国5亿元仅中国市场数据服务
综合判断2025年全球 3-10亿美元2030年 50+亿美元40-85%市场处于爆发前夜,预测分歧大

中国市场的增长尤为亮眼——2025年市场规模达5亿元人民币,同比增长203%,占全球约四成。中国核心优势在于全球最完整的机器人硬件供应链(成本仅为欧美的40-60%)以及丰富的制造业和服务业应用场景,为数据采集提供了天然的规模化基础。

从更宏观的视角看,中商产业研究院数据显示2025年中国具身智能整体市场规模约9150亿元,预计2026年突破10904亿元。高盛预测2035年全球人形机器人市场规模将达1540亿美元。数据采集作为占比约15%的上游基础设施,将直接受益于整个具身智能产业的规模化扩张。

Chapter 2

客户需求:数据饥渴驱动下的需求结构与付费逻辑

数据已经先于机器人本体实现规模化盈利,揭示产业链价值分布的结构性特征

2.1 需求端的「你有多少我买多少」

觅蜂科技CEO姚卯青对当前市场需求的描述最为生动:「需求方普遍是'你有多少我买多少,你什么时候有,我马上要'。」这一判断背后的逻辑链十分清晰:模型能力上限由数据决定→高质量数据极度稀缺→谁能率先获取数据谁就能在模型竞争中占据先机

具体来看,需求端呈现三个显著特征:

第一,需求主体多元且付费意愿强烈。数据采集的下游客户覆盖机器人本体企业(宇树、智元、银河通用等)、具身大模型公司(星海图、至简动力等)、科技大厂(京东、华为、蚂蚁等)以及垂直场景应用方。其中,大厂和头部本体企业是最核心的付费方,愿意为高质量数据集支付高溢价。

第二,需求层级分明,从预训练到精调各有侧重。行业普遍采用「海量视频数据(预训练打底)→仿真合成数据(泛化拓展)→真机遥操作数据(精调校准)」的递进式训练路径。这意味着不同类型的数据在产业链中都存在明确的商业价值,只是定价和毛利率差异显著。

第三,需求由模型参数量增长驱动,具有持续扩张性。模型参数从百万级提升至亿级后,数据需求量呈指数增长。正如新时达电气高级研究员丛正所言:「以前几百万参数的模型拿较少数据就能训练达标,现在几亿参数的复杂模型需要极大的数据量才能保障训练达标。」这一趋势意味着数据需求不会随着某一轮模型训练完成而消退,而是持续刚性增长

2.2 数据定价体系与盈利模型

具身智能数据的定价体系已初步形成,不同数据类型因采集成本和稀缺性存在显著价差:

数据类型典型售价采集成本毛利率核心客户
真机遥操作常规数据500-1000元/小时300-600元/小时40-55%头部本体企业、大模型公司
高动态数据(跑酷/打球等)10元/秒(3.6万/小时)60%+运动控制研发团队
无本体采集数据200-400元/小时100-200元/小时50-65%中小机器人团队
仿真合成数据按数据集/场景定价极低(仅为真机1%)70%+预训练阶段客户
标准化数据集(可复用)按license授权一次性投入80%+(复售)多客户复用

数据采集的商业模式具有典型的平台化溢价特征。光轮智能的标准化数据集复售率超10倍,单数据集可适配多家机器人厂商的VLA模型训练。鹿明机器人开起的「数据超市」覆盖10大场景、40多种任务,企业下单即可购买。这种「一次生产、多次销售」的模式使得边际成本持续下降,规模效应显著。

关键盈利拐点:一座投入不到9000万元的数据工厂,年营收可达数亿元。以帕西尼感知科技的天津采集工厂为例,累计采集近8000万条数据,按常规数据500-1000元/小时计算,年产能对应的营收天花板极高。这解释了为何多家企业正在加速扩建采集工厂。

2.3 需求结构演变趋势

展望未来3-5年,具身智能数据需求的演变将呈现以下方向:

从通用场景到垂直行业:当前采集数据以家居、通用操作为主,但随着工业场景率先落地(汽车制造、3C装配、电网巡检等),工业精密制造数据将成为溢价最高的品类。均普智能依托均胜集团全球百家工厂的制造场景切入工业数据采集,正是看准了这一结构性机会。

从「量」到「质」:随着行业标准化推进,单纯堆量的数据将面临贬值压力,而包含力触觉、多模态同步、失败轨迹、纠错样本的高质量数据集将享受更高溢价。一度科技专注的「力觉-视觉-位觉」对齐精细操作数据集,是这一趋势的典型代表。

从单次交易到长期订阅:行业领先的数据平台(如觅蜂科技的MEgo Engine、均普智能的Primus Forge)正在推动从「卖数据产品」到「数据基础设施服务」的商业模式升级,通过平台订阅费和持续数据更新服务构建更稳定的收入流。

Chapter 3

竞争格局:四大技术路线与五类玩家生态

43%的玩家选择跨路线布局,单一路线难以满足全链条需求

3.1 四大技术路线全景拆解

据量子位不完全统计,国内97家具身数据玩家中,70家专注数据采集、27家专注数据基础设施。在技术路线上,当前主流方案分为四大类别:

技术路线核心原理数据质量扩展性成本玩家数量代表企业
真机遥操作人操控真实机器人,同步采集动作/状态/传感器数据最高中低最高(500-1000元/h)22家(31%)帕西尼、千寻智能、国资平台
无本体采集人穿戴设备直接演示,无需机器人参与较高中等(为真机1/3)15家(21%)觅蜂科技、鹿明机器人、简智机器人
仿真合成在虚拟环境批量生成机器人交互数据中(Sim-to-Real有鸿沟)最高极低(真机1%)2家纯路线光轮智能、松应科技
互联网视频蒸馏从互联网视频提取人类动作知识转化为可学习数据最低最高最低(千分之五)1家纯路线枢途科技
跨路线融合同时布局多条路线综合优综合优取决于配比30家(43%)最多玩家选择

值得关注的是,跨路线玩家数量(43%)超过了任何单一路线。这说明行业共识是没有任何一种采集方式能独立满足机器人训练的完整需求。行业采用「数据金字塔」结构——底层用低成本视频/仿真数据做预训练,中层用无本体数据扩充场景覆盖,顶层用高成本遥操作数据做精调——这种融合路径正在成为主流。

路线选择的关键判断:真机遥操作是「重资产壁垒」路线,适合国资平台和头部企业;无本体采集是「轻资产规模化」路线,适合创业公司快速起量;仿真合成是「技术壁垒」路线,适合有强仿真能力的团队;视频蒸馏是「极低成本探索」,目前仅枢途科技一家纯押注。跨路线融合(觅蜂、光轮、鹿明等)是最受资本青睐的方向。

3.2 五类玩家画像与竞争位势

按企业背景和商业模式,97家国内玩家可分为五大类:

第一类:独立数据服务商(39家,40%)——赛道主力军

���光轮智能、觅蜂科技、帕西尼感知科技、鹿明机器人、简智机器人为代表。这类企业不造机器人本体、不开发大模型,专注数据采集与治理,是国内市场最大的玩家群体。优势在于中立性(可服务多家下游客户)、专业性和轻资产扩张能力。光轮智能估值已突破150亿元,是赛道首个独角兽。

第二类:国资数据平台(25家,26%)——重资产基础设施

以各地人形机器人创新中心、数据训练基地为代表。这类平台享有政府资金和场景资源支持,适合做真机遥操作等重资产路线。北京人形机器人创新中心数据基地日产能达600小时,已积累4万小时数据,合格率95%以上。劣势在于市场化程度和运营效率。

第三类:机器人本体企业(24家,25%)——内生数据飞轮

以宇树科技、银河通用、智元机器人、星海图为代表,自建数据采集产线,数据用于自身模型训练。宇树已全量开源189万条动作轨迹数据集;智元开放AGIBOT WORLD 2026数据集;银河通用构建了百亿级具身智能数据集。这类企业的数据能力可能向外部开放,成为第三方数据供应的竞争者。

第四类:工业/IT跨界企业(5家,5%)——场景壁垒型

以均普智能为代表,从智能制造、AI标注、自动驾驶等领域转型切入。均普智能依托母公司全球百家工厂的真实产线,发布Primus Forge数据平台和PrimusEgo采集设备,深度锚定工业精密制造场景——这是最稀缺、价值最高的数据资产来源。

第五类:大型平台公司(4家,4%)——生态级玩家

京东发布自研可穿戴采集终端JoyEgoCam,计划2年内完成1000万小时视频数据采集;华为推出CloudRobo;蚂蚁集团通过投资简智机器人、觅蜂科技等布局。这类企业不把数据采集作为主营业务,但凭借场景和数据规模优势可能重塑竞争格局。

竞争格局研判:当前市场处于早期充分竞争阶段,尚未形成寡头格局。但头部化趋势明显——光轮智能、觅蜂科技、帕西尼感知等已拉开与中小玩家的差距。我们判断,未来2-3年行业将经历一轮整合,最终形成3-5家具身数据平台型龙头+若干垂直场景专家并存的格局。

3.3 中美印全球分工:美国做平台,印度做外包,中国做基建

全球具身智能数据市场正在形成清晰的国别分工:

美国:平台层主导。Scale AI是海外标杆,从自动驾驶标注起家,深度绑定OpenAI做大模型评测。2026年3月与Universal Robots合作推出UR AI Trainer系统切入具身智能赛道,利用UR全球部署的机器人构建数据飞轮。NVIDIA则以Cosmos世界模型、Isaac Sim仿真平台和GR00T开源数据集定义全球数据基础设施标准。美国企业的核心优势在于技术平台和生态标准

印度:低成本劳动密集。印度走的是规模化人力采集路线,利用廉价劳动力进行大规模数据标注和动作示范采集。这种模式在成本上极具竞争力,但数据质量和标准化程度是主要制约。

中国:基建与产能领先。中国在三个维度上构建了独特优势:一是硬件供应链完整且成本仅为欧美40-60%,数据采集设备(手套、头显、传感器)国产化率快速提升;二是场景丰富度全球领先,制造业、服务业、家庭等场景为数据采集提供天然试验场;三是政府主导的基础设施建设速度和规模远超其他国家。全国已建立超43座人形机器人训练场,累计汇聚近3000万条具身智能数据。

竞争格局的深层含义:「美国头部公司论百亿美元,中国头部公司论百亿人民币。」中国估值最高的玩家不过二三十亿美元量级,而美国Figure一家就近400亿美元。资本量级的鸿沟,恰恰逼出了中国「用工程效率和数据规模弥补资本差距」的另类打法,这为S基金提供了估值更具安全边际的投资机会。
Chapter 4

一级市场:资本狂飙与估值分化

15家独立数据服务商一年融资44.7亿元,赛道从无人问津到资本追捧仅用一年

4.1 融资全景:从「数据荒漠」到「资本绿洲」

具身智能数据采集赛道在2025-2026年经历了从冷到热的极速升温。据量子位统计,过去一年(2025年7月至2026年7月),15家独立具身数据服务商(即不做机器人本体、不做大模型、只做数据)合计融资约44.7亿元人民币。这一数字放在整个具身智能赛道中也许不算惊人——上半年「大脑」方向的公司6个月就融资223亿元——但考虑到数据采集企业大多成立于2024年下半年到2025年,这一融资速度和规模已属罕见

2025年7月
简智机器人成立,4个月内密集完成三轮融资,蚂蚁集团、滴滴、德联资本联合领投,被业内称为「具身智能无本体数据领域迄今最大规模融资」,覆盖超3000名采集用户、沉淀超百万小时数据。
2025年8月
帕西尼感知科技完成超10亿元B轮融资,估值突破100亿元。比亚迪成为第二大股东,天津采集工厂累计采集近8000万条数据。
2026年2月
觅蜂科技从智元机器人分拆独立运营,种子轮+天使轮融资数亿元(红杉领投),CEO姚卯青判断「具身智能还没赚钱,数据先赚钱」。
2026年5月
光轮智能估值突破150亿元,同月再获蚂蚁集团领投的新一轮融资,成为全球首个具身数据独角兽。
2026年6月
光轮智能两周内连融20亿元,A++及A+++轮融资完成,经纬创投为主要投资方。同月觅蜂科技再融数亿元(国方创投领投),诺亦腾机器人完成数亿元Pre-A++轮融资。

4.2 核心标的估值与投资方图谱

当前赛道头部企业已形成清晰的估值梯队:

企业成立时间最新估值核心路线主要投资方核心优势
光轮智能2023年150亿+元仿真合成+无本体蚂蚁集团、经纬创投、中关村科学城基金仿真引擎+三层架构,客户覆盖NVIDIA/谷歌/Figure
帕西尼感知2021年100亿+元真机遥操+触觉比亚迪、黄浦江资本、凯泰资本6D触觉传感+实体采集工厂+OmniVTLA大模型
觅蜂科技2026年2月(分拆)数十亿元无本体+真机+仿真全覆盖红杉中国、国方创投、智元机器人MEgo设备+MEgo Engine平台+全范式覆盖
简智机器人2025年7月数十亿元无本体采集基础设施蚂蚁集团、滴滴、德联资本Gen DAS设备+Gen ADP数据产线+海外收入七成
鹿明机器人2024年未披露无本体采集未披露采集效率10倍提升+全球2/3顶尖团队采用
诺亦腾机器人2025年(分拆)数十亿元动作捕捉+无本体未披露全球70%动捕市场份额,服务60+机器人企业
灵初智能2024年未披露轻量化穿戴采集未披露100套数据手套+10万小时手部操作数据

从投资方结构看,产业资本+国资+头部VC的三角架构正在成为标配。产业资本(比亚迪投资帕西尼、蚂蚁投资简智/光轮/觅蜂)提供场景和订单验证,国资(中关村科学城基金、四川发展科创基金)提供政策和资金背书,头部VC(红杉、经纬)提供估值和退出通道。这一资本结构兼具确定性和成长性溢价,为后续IPO和并购退出奠定了多元化的股东基础。

4.3 估值逻辑的底层支撑:为什么数据公司比机器人公司更值钱?

这是一个值得S基金深入思考的反直觉现象:不造机器人的数据公司估值增速和盈利确定性超过了造机器人的本体公司。背后有三层逻辑:

第一层:盈利先行。当人形机器人本体企业还在亏损时,数据采集公司已经实现了正向盈利。光轮智能2026年Q1新增订单5.5亿元,超过2025年全年总和;无问智科一季度手握数亿元订单。觅蜂CEO姚卯青的判断已被市场验证:「在具身智能尚未真正大规模商业化之前,数据作为基础设施,会比终端应用更早形成商业回报。」

第二层:资产可复用。与机器人本体的一次性销售收入不同,数据资产具有「一次生产、多次贩卖」的特征。光轮智能的标准化数据集复售率超10倍,同一数据集可同时授权给多家机器人厂商。这种商业模式天然具备软件/SaaS行业的估值溢价——高毛利率、低边际成本、强网络效应。

第三层:客户中立性。独立数据服务商不制造机器人,因此可以服务全行业客户。这与Scale AI在AI标注领域的崛起逻辑一脉相承——当一个行业的所有玩家都需要同一种「铲子」时,卖铲子的人就是最确定的赢家。

S基金关注点:当前赛道存在估值分化过大的风险。头部企业(光轮150亿+)的估值已部分price in了未来3-5年的增长预期,而收入体量仍处于亿元级别,PS倍数较高。中等估值(数十亿元)的简智机器人和觅蜂科技具有更好的风险收益比。此外,部分明星项目的估值可能已出现泡沫化迹象——一周连融20亿的速度即便在2021年的消费互联网泡沫期也不多见。
Chapter 5

A股市场:上市标的梳理与对标分析

具身智能数据赛道在A股的直接映射有限,但间接关联标的正加速布局

5.1 A股直接相关标的

目前A股市场上,与具身智能数据采集直接相关的标的极为稀缺,这本身就是一个稀缺性溢价信号。具身智能数据采集作为一个2025年才真正爆发的新赛道,A股中纯正的标的凤毛麟角:

股票代码公司名称总市值2026Q1营收毛利率PE(TTM)具身数据业务进展
688787海天瑞声58.24亿9678万56.43%263x已与头部具身厂商签署真机数据采集合约;北京运营首个训练场,100+台机器人
688306均普智能102.56亿4.71亿18.07%1269x2026年7月发布Primus Forge数据平台+PrimusEgo采集设备;依托均胜集团全球百家工厂

海天瑞声(688787)从传统AI数据标注向具身智能数据领域延伸,2026年Q1营收同比增长38.63%,归母净利润同比增长2161%。公司已在北京运营首个具身智能数据训练场,依托100+台机器人实现高效数据产出。其传统业务(AI训练数据)的客户基础和标注能力可以为具身智能业务提供协同优势,但当前具身智能数据收入占比仍较低,是「转型中」而非「已转型」。

均普智能(688306)依托均胜集团60余年智能制造积累的全球百家工厂场景,于2026年7月发布工业具身智能数据平台Primus Forge。其核心差异化在于深度锚定工业精密制造场景——具身智能模型训练中最稀缺、价值最高的数据资产来源。但公司当前仍处于亏损状态(2026Q1归母净利润-3431万),具身智能数据业务尚属早期布局,对业绩贡献有限。

此外,新三板挂牌的数据堂(831428)也从2024年起正式布局具身智能数据,采用「场内模拟+场外真实」双轨采集策略,覆盖零售、家居、仓储、医疗等多类场景。但新三板的流动性和估值体系与A股不可同日而语。

5.2 A股间接关联与映射标的

除了直接参与数据采集的公司,A股中还有一批通过产业链环节间接受益的企业:

关联环节代表公司映射逻辑
动作捕捉设备利亚德(OptiTrack光学动捕)光学动捕是遥操作和动作采集的核心硬件,利亚德旗下OptiTrack全球市占率高
机器人本体优必选(港股)、宇树科技(IPO中)本体企业既是数据消费方也是数据生产方,宇树已开源189万条数据集
传感器柯力传感、汉威科技力/触觉传感器是数据采集设备的核心组件
算力基础设施中科曙光、浪潮信息仿真合成数据生成和模型训练需要大规模算力支撑

5.3 IPO管道与退出预期

具身智能赛道的IPO浪潮正在来临,这将为数据采集公司的退出通道提供重要参考:

对于S基金而言,数据采集公司的退出路径更加多元化:一方面可以跟随本体企业IPO浪潮享受估值提升,另一方面由于数据资产的高复用性和平台属性,被大厂(蚂蚁、京东、华为等)或头部本体企业并购的逻辑同样成立。独立数据服务商的中立性使其成为稀缺的并购标的——大厂和头部企业有强烈的数据基础设施自建需求,收购现成的数据平台是最直接的手段。

Chapter 6

催化因素:政策、技术与商业化的三重驱动

短期看政策落地,中期看标准化突破,长期看数据飞轮闭环

6.1 近期催化剂(0-12个月)

催化一:实景实训专项行动落地(2026年下半年)

工信部与国资委的专项行动要求在2026年11月30日前完成成效总结。10个重点省市将建设不少于200个重点场景单元(每省不少于20个),组建创新应用联合体,打造实景实训空间。这意味着2026年下半年将迎来一波集中性的数据需求释放——场景建设本身需要大量基准数据,联合体的模型训练需要持续数据供给,这将直接拉动数据采集公司的订单增长。

催化二:宇树科技IPO定价(预计2026年内)

宇树科技作为A股「人形机器人第一股」,其IPO定价和上市后股价表现将确立整个具身智能产业链的二级市场估值基准。如果IPO定价对应较高估值(当前预估约420亿元),将推动一级市场估值中枢上移,数据采集公司作为产业链最上游的「卖铲人」将率先受益。

催化三:标准化体系推进

2026年2月发布的《人形机器人与具身智能标准体系(2026版)》是行业从混乱走向有序的关键一步。标准化将降低数据跨本体迁移的门槛,打破「数据孤岛」,使得同一份数据可以服务更多下游客户——这将直接提升数据采集公司的资产利用效率和毛利率

6.2 中期催化剂(1-3年)

催化四:Sim-to-Real技术突破

仿真数据与真实数据的鸿沟(Sim-to-Real Gap)是当前制约仿真合成路线商业价值的最大瓶颈。NVIDIA Cosmos世界模型和光轮智能等企业的高保真仿真引擎正在缩小这一差距。一旦Sim-to-Real问题得到实质性突破(仿真训练的策略在真实机器人上的成功率超过80%),仿真合成路线的数据价值将实现数量级跃升,因为其边际成本趋近于零的特性将彻底改变行业成本结构。

催化五:工业场景率先跑通商业闭环

多位行业人士判断,2026-2027年工业场景是最有希望承载具身机器人规模商用的场景。汽车制造(宁德时代、比亚迪、博世)、3C电子、电网巡检等场景由于相对封闭、任务标准化程度高,是数据采集第一批实现商业闭环的领域。均普智能、一度科技等聚焦工业场景的玩家可能率先证明商业模式。

催化六:跨境数据流通与全球化

简智机器人海外收入占比已超七成;光轮智能的客户名单覆盖NVIDIA、谷歌、Figure等海外巨头。中国数据采集公司凭借成本优势和规模效应,正在从「服务国内市场」走向「全球化供给」。这一趋势的持续强化将打开数倍于国内市场的成长空间。

Chapter 7

总结与S基金视角:投资机会与退出路径研判

现金流确定性、退出路径可行性和估值安全边际——S基金三维决策框架下的赛道评估

7.1 赛道核心结论

经过系统研究,我们对具身智能数据采集赛道的整体判断如下:

赛道定位:具身智能产业链上游基础设施,类似AI时代的「数据炼油厂」。处于从早期扩张向行业整合过渡的关键窗口期。
增长确定性:极高。百倍以上的数据供需缺口、模型参数量指数增长、政策强制推动标准化训练场建设,三重因素锁定需求增长。
盈利可见性:高。数据采集公司已率先实现正向盈利和规模化收入,商业模式验证程度高于下游本体企业。
竞争格局:充分竞争阶段,头部化在加速,但尚未形成寡头格局。预计2-3年内行业整合,形成3-5家平台型龙头。
估值水平:头部分化。独角兽级别(光轮150亿+)估值已较高,中等估值(数十亿元)标的具有更好的风险收益比。

7.2 S基金投资视角:三维决策框架

维度一:现金流确定性

从S基金偏好的现金流视角看,具身智能数据采集赛道具有高度吸引力:

维度二:退出路径可行性

数据采集公司的退出路径较传统制造业企业更为多元化:

维度三:估值安全边际

按S基金3-7年持有周期的估值安全边际评估:

7.3 投资建议与关注标的优先级

优先级标的类型代表企业核心逻辑S基金参与方式
第一梯队全路线平台型数据服务商光轮智能、觅蜂科技估值虽高但确定性强,全范式覆盖+平台化交付,客户结构全球化关注老股转让机会,需折价安全垫
第二梯队垂直场景数据专家帕西尼感知(触觉)、一度科技(灵巧手)、鹿明机器人(无本体)技术壁垒高、细分赛道龙头、估值相对理性LP份额交易首选,持有至并购退出
第三梯队基础设施型数据平台简智机器人、公象智能轻资产模式、可规模化、海外收入占比高早期LP份额交易,关注海外扩张进度
A股映射转型布局的上市公司海天瑞声、均普智能具身数据业务占比低但增长快,A股稀缺性溢价二级市场配置,关注业务占比拐点
风险提示:(1)行业估值泡沫风险——部分标的估值已严重脱离实际经营水平,一周连融20亿的速度不可持续;(2)技术路线风险——仿真路线的Sim-to-Real鸿沟若无法突破,押注单一技术路线的公司可能面临价值重估;(3)数据标准化推进不及预期——若行业标准迟迟无法统一,「数据孤岛」问题将长期拖累数据复用率和毛利率;(4)政策节奏风险——专项行动若未能有效转化为实际订单,数据采集公司的收入增长可能低于预期。

7.4 报告总结

具身智能数据采集是2026年最具确定性的AI基础设施赛道之一。在人形机器人产业化的宏大叙事中,数据作为「新的石油」,正在成为决定行业竞争格局的关键战略资源。我们看到:数据已经先于机器人本体实现盈利,独立数据服务商以「卖铲人」的身份率先享受了行业红利。

从S基金视角出发,该赛道的核心投资逻辑在于:选择具备平台化能力、跨路线布局、客户结构多元化、且估值处于合理区间的独立数据服务商,以LP份额交易或老股转让方式参与,持有至IPO或产业并购退出。在估值泡沫和确定性增长之间寻找平衡,将是S基金在该赛道获取超额回报的关键。

· · ·

—— 博瑔资本 S基金投研小队 ——
本报告仅供内部研究参考,不构成任何投资建议。数据来源截至2026年7月28日。