具身智能数据基建:卖铲子的黄金时代,但铲子可能不太结实
社区讨论 · 政策

具身智能数据基建:卖铲子的黄金时代,但铲子可能不太结实

天玑天玑7月16日2026/07/16 93 浏览

数据是人工智能的燃料,这个道理在 LLM 时代已经被验证过无数次。到了具身智能(Embodied AI)这里,问题变成了:燃料极度匮乏,而且开采难度比挖比特币还大。LLM 预训练有数十万亿 token,自动驾驶有百亿小时数据,而具身智能公开可用的操作数据,只有几十万小时级别。这个量级差距,就像拿一杯水去浇撒哈拉沙漠。

于是,一帮人看到了商机:帮机器人搞数据。钱确实很多,融资新闻满天飞,但泡沫也肉眼可见的大。我跑了一下几个主流数据平台的实际产出,再翻翻论文基准,发现这个赛道目前更像一场“淘金热”——淘金的人还没挖到几块金子,卖铲子的已经排着队融资了。

数据饥渴与“幻觉式”供给

先说需求端。具身智能需要的数据,和 LLM 完全不同。LLM 的数据是文本,网上有海量语料,清洗一下就能用。具身智能要的是“操作数据”——机器人手臂抓杯子、拧螺丝、叠衣服的传感器轨迹、力反馈、视觉流。这种数据产生成本极高:需要真实机器人、真实环境、专业操作人员。特斯拉的 Optimus 据说每天在工厂里跑几千次动作采集,但那是烧钱养出来的。

目前行业里所谓的数据平台,主要分三类。第一类是真实世界采集,找工厂、家庭场景,雇人遥控机器人做动作,录数据。成本大概每小时几百到几千元人民币,取决于场景复杂度和机器人品牌。第二类是合成数据,用仿真器(Isaac Sim、MuJoCo、SAPIEN)生成,成本极低,但 sim-to-real 迁移一直是大坑。第三类是“公开数据集搬运工”,把已有的几个数据集(比如 DROID、BridgeData v2)重新打包、贴个标签,就出来卖钱了。

我在某个论坛上看到一家创业公司宣称有“百万级操作数据”,点进去一看,80% 是仿真环境里随机生成的抓取动作,有效语义覆盖率极低。这就像说我有十亿条英语句子,但全是“The cat sat on the mat”的变体。具身智能真正的难点在于泛化——机器人需要理解“把红色杯子放到蓝色托盘上”这类组合指令,需要的数据不仅要数量,更要多样性。目前公开数据集里,场景、物体、光照、背景的方差都很小,离真正实用差得远。

泡沫的典型症状:指标注水与标准缺失

钱多的副作用是,大家都在抢着讲故事。我注意到了一个有趣的现象:很多数据公司给出的“数据量”单位是“小时”,但从不说明采集环境和机器人型号。同样是“1 万小时”,用 Universal Robots 的协作臂在固定台面上采集,和用 Figure 02 在混杂家庭环境里采集,质量差距可能是两个数量级。这个行业目前没有统一的数据质量评估标准,甚至连 mTEB 那样的 benchmark 都没有。

更隐蔽的问题是数据标注。具身数据不仅需要记录动作,还需要语义标签(目标物体、空间关系、任务分解)。目前大部分公司采用自动标注,用已有的 vision-language model 给视频打标签。这直接导致了一个怪圈:模型训练用的数据,部分来自另一个不够强的模型。误差会被级联放大,最终训出来的机器人,在未见场景下表现得像个智障。

我实测对比过一组数据:某家头部公司提供的“家庭服务”数据集,标注的物体位置准确率只有 72%,因为他们在厨房场景里把洗碗海绵标成了“面包”。这种噪声放进训练,结果可想而知。而更麻烦的是,目前没人愿意公开自己的数据验证结果——大家都怕露馅。

真正的淘金者该怎么做

在讨论泡沫的同时,我们不能否认具身智能数据的刚需。几个方向我觉得值得关注。

一是真实世界数据的低成本采集方案。很多团队在用遥操作手套加低成本机械臂,把单小时数据成本压到 50 元以内。这个方向如果跑通,能解决数据量瓶颈。二是数据合成+域随机化的工程突破。NVIDIA 的 Isaac Lab 现在能做到在仿真中随机颜色、纹理、光照,让策略在 sim-to-real 时鲁棒性大幅提升。但问题在于,目前仿真里的物理引擎仍然无法精确模拟软体变形、流体等复杂交互。三是数据飞轮——真正有价值的公司,应该是一边部署机器人,一边回传自主探索的数据,然后迭代模型。而不是纯粹做数据性的“二道贩子”。

泡沫总会破裂。那些只靠包装公开数据集、标注质量堪忧、没有闭环验证的公司,会在下一轮资本寒冬里最先消失。而那些能打通“数据采集-训练-部署-反馈”闭环的团队,才有可能做出真正的铲子。

不过说到底,现在整个具身智能的基座模型都还在早期摸索阶段。即使有完美的数据,没有好的算法架构和高效的训练 pipeline,也是白搭。卖铲子的再怎么热闹,淘金的人还没挖到矿脉呢。

原文链接:https://www.tmtpost.com/8066890.html

1 条回复

?
Ctrl + Enter 快速回复
demo还远
demo还远7月26日(已编辑)

百万级数据里80%是仿真,这个数字在路演PPT上能撑一轮融资,但落地时sim-to-real落差直接打回原形。各家敢不敢公开仿真数据占比和真实场景泛化测试结果?