WRC2026观察:“明线”是落地,“暗线”是数据互联网+
星海图的真实数据家底包括2025年9月开源的GOD真实场景数据集,这个数据集的规模是10万小时第一视角人类数据,要赌群众路线 光轮智能是本届WRC上在数据层面动作最大的玩家之一。
文 | 智能相对论
作者 | 叶远风
本届WRC,人形机器人在传送带上分拣包裹、在工位上拧螺丝,这样的“干实事”情境与依旧热闹的表演型展出一样成为了常态,这是很多人欣慰的行业进步。
但回过头来看,这并不是WRC 2026的全部,至少只是“明线”的部分。
“有多少数据,尤其是有多少高质量数据,就有多少AI能力。”宇树科技创始人王兴兴在WRC上说的这句话,几乎是本届大会所有厂商心照不宣的共识。人形机器人的四肢已经练得差不多了,能跑、能跳、能空翻、能上下楼梯,“大脑”还饿着。

问题是,喂大脑的那口数据从哪来?
一组在WRC上被反复引用的数据是,当前国内真实物理交互场景合规数据仅50万小时,而机器人商业化落地需要数千万小时,缺口超过99%。
从十万到千万,这中间差着两个数量级。
于是,整个WRC,“数据”成为一条暗线。
各路玩家各显神通,有人开源人类行为数据,有人卖数采手套,有人押注仿真,有人坚持真机真实数据。
在这场喧嚣中,有一些具身智能公司没有展台、几乎不被注意,却握着全行业最稀缺的那批数据。
开源人类数据,要赌群众路线
光轮智能是本届WRC上在数据层面动作最大的玩家之一。
8月20日,他们发布了全球首个十万小时级全模态人类行为开源数据集EgoSuite-Open100K。
这个数据集的规模是10万小时第一视角人类数据,覆盖7大类环境、128类场景、15000多个采集场景和15000多项任务。
数据以头戴第一视角为主体,部分增加腕部摄像头,提供手部姿态、全身姿态和事件级语义标注,首批数据已经通过Hugging Face开放下载。
光轮智能CEO杨海波解释为什么要推进这样的数据路线,他认为单纯依靠真机遥操作,很难支撑千万小时以上级别的训练素材供给,行业迫切需要人类视频数据、仿真合成数据两条路径并行。

所以光轮的打法是“群众路线”——开源人类行为数据,搭建Real2Sim2Real持续学习闭环,甚至提出了一个5年100亿小时的具身智能数据共建计划——用大白话说,就是我一个人采不完,那就让全行业一起采。
真实数据+仿真并行,两条腿走路
目前小比例的真实数据+大比例的仿真数据,是数据缺乏下的权宜之计,也成为很多产业链企业主攻的方向。
星海图是这一派的代表,CEO高继扬在WRC上明确表态:坚持优先使用真实数据,他算了一笔账,综合数据成本、算力成本和研发工程师人力成本三部分后,“数据成本其实相对可控,并没有想象中那么高,最贵的反而是研发工程师的时间。”

星海图的真实数据家底包括2025年9月开源的GOD真实场景数据集,下载量全球第一;通过投资简智、元流等公司扩充数据来源;计划2026年将真实数据规模做到100万小时。
但与此同时,星海图也没有放弃仿真,论文引用量位居世界模型领域第一。
某种意义上,高继扬的表态更像是一种理想,当前仿真数据仍然是具身智能训练的大头,未来所有人都想尽可能多用真实数据,只是现在没有那个条件罢了。
即便是当红炸子鸡宇树科技在通过真实机器人运行数据让机器人进一步适应物理世界外,海量互联网数据做预训练也是无法避免的。
两条腿走路,一条负责脑补世界、“见多识广”,一条负责“脚踏实地”,这会是具身智能很长一段时间发展的常态。
在矿坑里跑出来极端工况真实数据
盘点到这里,你可能发现了一个问题,上面所有玩家的数据,不管是人类行为视频、仿真合成、还是真机遥操作,几乎都来自相对标准化、结构化、安全可控的场景,比如实验室、工厂车间、家庭环境等等。
但有一类数据,上面所有方法都采不到。
那就是极端工况下的真实物理交互数据——地下1000米的矿井里、上千摄氏度的冶炼炉旁、露天矿山的爆破区边缘、粉尘和光照干扰下的强混行混编作业现场。
这些场景,人类不愿意去(63%的矿山事故是人为造成的),仿真模拟不了(非结构化极端工况的物理复杂度超出仿真引擎的建模能力),遥操作采不动(通信延迟、遮挡衰减、多车信道拥塞)。
希迪智驾握着的,恰恰是这批数据。
在WRC的主题演讲中,希迪智驾CEO胡斯博亮出了一组数字:截至2026年上半年,希迪自动驾驶车队规模超3400台,其中无人矿卡累计出货超1900台,覆盖全球近40座矿山,单矿常态化运行规模最高达220台。

这意味着什么?意味着1900台重型机器,每天在40多座极端工况的矿山里真实运行,持续产生感知、决策、执行全链路的一手数据。这不是实验室里的干净数据,不是仿真器里的合成数据,不是人类戴头环拍的行为视频——这是机器在真实地狱环境里干出来的数据。
胡斯博在演讲中说了一句很关键的话,“自动驾驶沉淀的不仅是算法和里程,还是1900台车每天在40多座矿山里跑出来的认知,更是机器对物理世界的理解。”
这句话的潜台词是,重载具身智能的护城河不是模型参数,是极端工况下的真实数据积累。
基于这批数据,希迪构建了一套三层架构的重载具身智能技术平台:
底层是统一数据引擎,汇聚生产、环境、车辆多维数据;
中间是重载世界模型,终端行动模型负责毫秒级实时决策,云端训练模型持续迭代;
上层是集群决策与调度系统,单场景可调度超1000个智能体。
更重要的是,希迪没有停留在“运输”这个环节,70%的矿山作业环节是非运输的——钻、爆、挖、装,希迪正在把从运输数据中训练出来的“大脑”向作业全工序延伸:挖采机器人已经出货34台,露天矿装药机器人实现寻孔、装药、移车全环节无人化,冶炼抱罐机器人在上千摄氏度高温下转运75吨渣罐,井下采矿掘进机器人已经完成整机制造。

而支撑这一切的商业基本面,是一组在具身智能赛道显得格外“刺眼”的数据:2026年上半年总营收8.04亿元,同比增长97%;毛利2.12亿元,同比增长204%;自动驾驶收入同比增长107.3%。
在全行业普遍高投入烧钱的背景下,希迪是少数已经跑通商业闭环、有清晰盈利路径的玩家。
希迪的定位也很清晰,不做终端、只做大脑,做重型机器智能化的技术合伙人。
这种“大脑供应商”模式让它可以轻装上阵,把算法、数据和集群调度做到极致,同时沿着载体、场景、出海三条线扩张,与质子汽车、云深处科技合作,从矿山延伸到冶炼、物流园区,把中国方案带向澳大利亚、巴西、印尼等资源型国家。
数采硬件,卖挖矿的铲子也是一门好生意
如果说数据是黄金,那这一派卖的就是挖矿的铲子。
WRC现场,数采硬件厂商集体爆发。
章鱼动力摆了三款产品:鱼眼头环、肌电手环、外骨骼同构数采手套,合起来叫OctoSense,其中最核心的卖点是全球首次实现肌电跨个体零样本泛化,其背景是传统肌电采集的老大难是每个人的肌电信号差异太大,章鱼动力试图让人类操作数据近乎无损地对齐真机。

自变量也在现场设了无本体数据采集演示区,三款数采硬件统一数据输出标准,采集素材能无缝接入自己的数据服务管线。
大晓机器人带来了环境式数据采集方案2.0,用ACE Ego Kit、ACE Data Engine和ACE Ego Matrix构建从采集、自动标注到跨本体应用的完整链路。
BrainCo的思路更综合,灵巧操作数采矩阵整合了真机执行、真人示教与仿真生成三种数据来源——双臂轮式数采平台同步采集视觉、触觉、运动状态,外骨骼人类数采手套记录真人操作过程,把人的动作经验转化为机器人学习的数据。

当然,还有一些更前沿的做法。
比如傅利叶提出了“脑机数采”模式,围绕脑、人、机建立数据体系,核心目的是比较“执行、想象、遥操作机器人”三种状态下的脑电差异,为运动想象研究提供基础设施。强脑科技则直接在现场演示了脑机接口如何连接人和机器人:人产生动作意图,传感器采集与任务相关的脑电信号,转化为机器人控制系统可执行的指令,驱动人形机器人完成相应动作。

还有瞰瞰智能把时髦的智能眼镜纳入进来,推出了一款只有56克的超轻量车规级精度异构数采眼镜,主打真实场景被动海量数采。
无论那种做法,这一派的特点都试图做数据采集的基础设施,其逻辑很简单,你们都缺数据,那我就卖你们采数据的工具。
结语
WRC开发者之夜上,有人提出了一个五层数据递进框架:人类示范提供知识先验,真机执行提供现实经验,仿真提供探索效率,失败数据提供边界突破,产业场景提供可持续闭环。
这五层里,最稀缺、最值钱的是最后两层——失败数据和产业场景闭环数据。因为前三层可以靠开源、靠硬件、靠仿真来规模化,而最后两层,只能靠真刀真枪在产业现场跑出来。
从这个角度看,WRC 2026的数据暗战其实已经分出了层次,光轮们在拼数据规模的广度,章鱼们在拼数采工具的精度,星海图们在拼真实+仿真的平衡,而希迪智驾,在拼一个别人根本进不去的赛道,极端工况下的产业闭环数据。
当300多家企业在亦庄的展馆里教机器人怎么抓取、怎么分拣、怎么拧螺丝的时候,1900台无人矿卡正在40座矿山里,在粉尘、高温、强混行的环境下,持续生产着全行业最稀缺的那批“脏数据”。
人形机器人的终局是走进家庭,但在那之前,有一批机器必须先走进地狱。而地狱里跑出来的数据,才是真正无法被复制的护城河。
*本文图片均来源于网络
此内容为【智能相对论】原创,
仅代表个人观点,未经授权,任何人不得以任何方式使用,包括转载、摘编、复制或建立镜像。
部分图片来自网络,且未核实版权归属,不作为商业用途,如有侵犯,请作者与我们联系。
•AI产业新媒体;
•澎湃新闻科技榜单月度top5;
•文章长期“霸占”钛媒体热门文章排行榜TOP10;
•著有《人工智能 十万个为什么》
•【重点关注领域】智能家电(含白电、黑电、智能手机、无人机等AIoT设备)、智能驾驶、AI+、、、AI+、AI+、AR/VR、、开发者以及背后的芯片、算法等。
1.TMT观察网遵循行业规范,任何转载的稿件都会明确标注作者和来源;
2.TMT观察网的原创文章,请转载时务必注明文章作者和"来源:TMT观察网",不尊重原创的行为TMT观察网或将追究责任;
3.作者投稿可能会经TMT观察网编辑修改或补充。
